大模型效率研究员
北京、上海
社招
全职
研发 - 基础架构
大模型系统
职位描述
我们正在寻找一位能够端到端从模型算法、系统软件与硬件角度思考模型效率的研究员。从模型设计早期出发,需要你和算法及训练、推理团队共同探索模型结构,评估其在真实硬件和业务负载下的效率与成本,推动模型能力、训练效率和推理性能的协同提升,同时关注模型效果。 岗位职责 - 参与模型结构设计:从硬件能力、分布式训练和推理系统的视角,参与 Attention、MoE、条件计算、参数共享、量化及缓存机制等设计,提出可验证的架构方案。 - 建立端到端评估方法:建立计算、访存、通信及存储的性能与成本模型,分析模型结构对训练吞吐、显存占用、收敛表现,以及推理 TTFT、TPOT、吞吐和服务成本的影响。 - 关注效率与模型效果的tradeoff:能够端到端参与到模型效果评估,可以衡量基于效率的变更对效果的影响,从而找到最佳的tradeoff。 - 推动模型与硬件协同设计:结合加速器的计算精度、内存层级、带宽、互联拓扑和执行特性,识别架构瓶颈,为模型规模、层数、宽度、稀疏度及算子形态提供设计依据。 - 协同设计训练与推理方案:评估模型结构与并行策略、通信调度、算子融合、KV cache 管理、Prefill/Decode 分离及投机解码的适配关系,形成可落地的系统方案。 - 完成原型与实验验证:通过性能建模、微基准、关键算子或系统原型及模型实验,验证架构假设,区分理论收益与实际端到端收益。 - 推动方案进入生产:与算法、Kernel、训练及推理工程团队协作,推动架构方案从设计、实验到规模化部署,并持续评估不同上下文长度、并发规模和业务负载下的表现。
职位要求
任职要求 - 具备跨团队协作能力,能够与算法及系统工程团队共同定义问题、设计实验并推动交付。 - 深入理解大语言模型的核心结构与计算过程,熟悉 Transformer、Attention、MoE 等机制,能够分析其计算复杂度、数据流和内存开销。 - 在大规模模型训练或推理系统方面具有扎实经验,并能够理解另一侧的关键约束及架构权衡。 - 熟悉 GPU 或其他 AI 加速器的体系结构,理解计算、访存、通信之间的关系,具备性能分析、瓶颈定位与优化能力。 - 熟悉分布式计算及常见并行策略,能够分析模型结构与设备拓扑、通信模式、调度方式之间的相互影响。 - 具备较强的工程与实验能力,熟练使用 Python、PyTorch,能够通过代码、Profiling 和实验数据验证设计判断。 - 能够在模型质量、训练成本、推理延迟、吞吐、可靠性和实现复杂度之间进行定量权衡,并清晰表达设计依据。 加分项 - 参与过模型结构与训练、推理系统的联合设计,并有规模化落地经验。 - 在长上下文、稀疏 Attention、MoE、低精度训练与推理、KV cache 优化或投机解码等方向有深入实践。 - 具备 CUDA、Triton 或其他加速器编程经验,能够实现并优化关键算子。 - 有大规模集群性能建模、容量规划,或跨硬件平台适配经验。 - 在模型架构、机器学习系统或计算机体系结构方向有高质量研究成果或开源贡献。
投递

MiniMax is a leading global technology company and one of the pioneers of large language models (LLMs) in Asia. Our mission is to build a world where intelligence thrives with everyone.
MiniMax develops proprietary LLMs across various modalities, including a trillion-parameter MoE model, a speech model with low latency and native support for major Asian languages, and a state-of-the-art text-to-speech and text-to-video models. Experience it now at https://hailuoai.com/
Leveraging these multi-modality general-purpose models, the MiniMax API Platform offers enterprises and developers secure, flexible, and reliable API services, enabling the rapid deployment of AI applications.