Dcar

后训练Infra工程师

Dcar  •  Onsite  •  4 hours ago
Apply
AI can make mistakes so check important info. Chat history is never stored.

Job Description

后训练Infra工程师

北京

社招

全职

职位 ID:A108849

职位描述

岗位定位:建设后训练框架与平台,提升训练效率、稳定性和易用性,支撑算法迭代与 Agent 业务落地。 岗位职责: 1、平台建设:统一 SFT、DPO、GRPO 等训练流程,完善任务编排、资源调度、环境与产物管理、实验追踪和故障恢复; 2、Agent RL 基建:建设 rollout、沙箱及工具交互环境,支持多轮交互、异步采样与训推协同; 3、性能与稳定性:优化显存、通信、吞吐及资源利用率,解决 hang、OOM、训练异常等问题,提升有效训练时间占比与任务成功率; 4、数据与评测管线:集成数据处理、评测和回归能力,打通业务数据、训练、评测与问题反馈闭环。

职位要求

1、熟悉大模型训练,有 Megatron、DeepSpeed、Swift、verl 等框架的深入使用或二次开发经验; 2、理解分布式并行、NCCL 通信、显存管理及 checkpoint 机制,有实际性能调优经验; 3、系统基础扎实,熟悉性能分析与分布式调试,能独立定位训练稳定性问题; 4、理解或有意深入 RL 后训练系统,关注 rollout、沙箱、训推一致性等问题; 加分项 5、有 RLHF / Agentic RL、数据管线或训练评测平台建设经验; 6、有千卡级集群稳定性、有效训练时间或成本优化成果; 7、有训练、推理框架的实质性开源贡献。

投递

Dcar

About Dcar

Industry
Unknown
Company Size
Unknown
Headquarters
Unknown
Year Founded
Unknown
Social Media
Unknown