Dcar

Post-Train Infra开发工程师

Dcar  •  Onsite  •  5 hours ago
Apply
AI can make mistakes so check important info. Chat history is never stored.

Job Description

Post-Train Infra开发工程师

北京

社招

全职

职位 ID:A224223

职位描述

团队定位:为公司模型迭代提供基建与保障,降本增效——降低算力成本,提高模型开发效率。 岗位定位:开发并优化 Post-Train(后训练)框架与基础设施,把环境、框架、稳定性等收进 infra,让算法专注于实验与业务效果本身。 岗位职责: 1、开发并优化 Post-Train 框架,包括但不限于:RL rollout 运行沙箱集群、Agentic RL 多轮调度、RL 训推不一致治理等,持续降低后训练的使用门槛; 2、训练效率优化:深入训练全链路,覆盖显存优化、吞吐与延迟优化、通信加速等手段,提升训练综合 ETTR 这一核心指标,提升资源整体利用率; 3、训练稳定性保障:解决算法同学遇到的通信 hang、OOM、框架参数、模型结构不支持、算子版本不支持等问题,保证训练任务的成功率; 4、跟进 SFT / DPO / GRPO 等后训练范式的工程落地,抽象通用组件沉淀到统一训练框架中。

职位要求

1、熟悉大模型训练原理与流水线,有 Megatron / DeepSpeed / Swift 等框架的深入使用或二次开发经验; 2、理解分布式训练核心技术:数据/张量/流水线并行、NCCL 通信、显存管理、混合精度,有实际的性能调优经验; 3、有扎实的系统功底,能定位 hang、OOM、性能劣化等疑难问题,熟悉 nsys / 火焰图 / 日志链路排查手段; 4、对 RL 后训练(PPO / GRPO / Agentic RL)的系统架构有理解或强烈兴趣,了解 rollout 与 training 的协同模式; 5、自驱、能啃硬问题,愿意长期跟踪训练框架与系统方向的前沿进展。 加分项: 1、有 RLHF / Agentic RL 系统(rollout 集群、环境沙箱、异步采样调度)建设经验; 2、有大规模训练(千卡以上)稳定性保障或 ETTR 优化的量化成果; 3、在训练框架开源社区(Megatron / DeepSpeed / Swift / verl 等)有实质性贡献。

投递

Dcar

About Dcar

Industry
Unknown
Company Size
Unknown
Headquarters
Unknown
Year Founded
Unknown
Social Media
Unknown