大模型训练框架工程师-2028届
北京、上海
校招
实习
研发 - 算法
2028届实习生招聘
职位描述
训练顶尖大模型不仅依赖算法创新,也依赖稳定、高效、可扩展的训练系统。随着模型规模和训练复杂度持续提升,训练效率、并行策略、通信开销、显存管理、Checkpoint、容错恢复、大规模数值正确性保证和系统稳定性,都会直接影响模型迭代速度和能力上限。 我们正在建设 MiniMax 大模型训练框架,支撑更大规模、更高效率、更稳定的训练任务。你将与算法团队在模型架构设计和训练方案制定阶段深度协作,从系统视角参与技术判断,识别潜在瓶颈,并推动训练系统持续优化。 你会参与: - 建设和优化大规模训练框架,支撑千卡/万卡级别训练任务; - 优化数据并行、张量并行、流水线并行、专家并行等并行策略; - 解决大规模训练中的通信、显存、Checkpoint、容错恢复、数值正确性校验和稳定性问题; - 分析模型结构、训练策略与系统效率之间的关系,提升训练吞吐、资源利用率和迭代效率; - 跟进 PyTorch、Megatron-LM、DeepSpeed、TorchTitan 等训练框架及相关前沿工作,并结合实际训练场景落地。 我们希望你在分布式系统、GPU 性能优化、并行计算、通信优化、训练框架或系统稳定性等方向具备扎实积累,同时对大模型训练系统保持持续兴趣,愿意面对真实复杂系统中的高难度问题。
职位要求
基本要求: - 编程能力扎实,具备清晰的系统设计思路和良好的工程品味; - 对大模型训练系统、分布式系统、并行计算、GPU 性能优化或大规模数值正确性保障中的某一方向有深入理解; - 能够独立定位系统问题,提出可落地的优化方案并推动实施; - 关注算法与系统前沿,能够将论文或开源框架中的思路转化为工程判断。 加分项: - 熟悉 PyTorch、Megatron-LM、DeepSpeed、Colossal-AI、TorchTitan 等训练框架,并有深入使用或贡献经验; - 有千卡/万卡规模训练系统经验; - 熟悉 NCCL、RDMA、CUDA、Triton、通信优化、显存优化、Checkpoint 优化、大规模训练数值稳定性与正确性保障等技术; - 有 MoE 训练、长序列训练、混合并行策略优化或训练稳定性治理经验。
投递

MiniMax is a leading global technology company and one of the pioneers of large language models (LLMs) in Asia. Our mission is to build a world where intelligence thrives with everyone.
MiniMax develops proprietary LLMs across various modalities, including a trillion-parameter MoE model, a speech model with low latency and native support for major Asian languages, and a state-of-the-art text-to-speech and text-to-video models. Experience it now at https://hailuoai.com/
Leveraging these multi-modality general-purpose models, the MiniMax API Platform offers enterprises and developers secure, flexible, and reliable API services, enabling the rapid deployment of AI applications.