AI算力平台项目经理(AI Infra方向)
上海
全职
职位描述
职位要求
硬性基础要求 本科及以上计算机 / 电子 / 自动化相关专业,3-5 年技术项目管理 TPM 经验;有AI 智算集群、GPU 训练 / 推理平台、云原生 K8s项目管理完整经验。 具备大型跨团队项目统筹能力,独立主导过百人级、多模块并行的基础设施交付项目,完整走完需求 - 研发 - 测试 - 上线 - 运维闭环。 熟练使用项目管理工具:Jira、Confluence、飞书项目 / 禅道;具备完整风险管控、里程碑、验收交付实战经验。 技术能力核心(AI Infra TPM 区分普通 PM 关键) 精通 AI 智算基础架构:熟悉 GPU 集群、RoCE 高速网络、分布式存储、液冷机房部署流程;了解 HPC、千卡集群交付全流程风险点。 掌握云原生底座核心栈:Docker、K8s、CSI 存储、CNI 网络、RBAC、DaemonSet/StatefulSet、GPU Operator、Volcano 调度器、KServe 推理框架。 懂大模型训推基础流程:PyTorch 分布式训练、模型并行、量化加速、vLLM/Triton 推理、HF 模型下载、算子编译流程;能看懂基础性能指标(MFU、AllReduce 时延、推理 P99 时延)。 具备基础 Linux 运维认知,能看懂集群监控、故障日志,可独立组织压测、性能调优专项评审。 了解具身智能场景加分:Isaac Sim 仿真、ROS2 机器人、云边协同、多模态传感器数据流。 软素质 极强跨部门推动、冲突协调能力,面对多方诉求可做技术与业务平衡取舍; 强风险预判能力,能提前识别算力交付延迟、硬件兼容、线上稳定性、成本超支等风险并制定缓解方案; 数据驱动思维,擅长搭建指标看板、通过量化数据定位瓶颈,输出可落地优化方案; 优秀文档、汇报能力,可独立输出架构方案、项目报告、管理层汇报材料; 抗压,可同步管理多个并行大型基建项目,适应 AI 业务快速迭代节奏。 三、优先加分项 有千卡 / 万卡智算中心建设、IDC 机房交付、NVIDIA 超算集群项目 TPM 经验; 具备 SRE、后端开发、运维、HPC 技术背景转 TPM; 熟悉大模型训练、推理优化、算子库(CUTLASS/FlashInfer)、推理引擎开发流程; 有 FinOps 算力成本治理、云边一体化平台、人形机器人云平台项目经验; 持有 PMP、ACP 项目管理证书。
投递

AGIBOT is an Embodied AI foundation model company developing both the intelligence layer and the corresponding robotic embodiments needed to bring general intelligence into the physical world. Founded in 2023, AGIBOT is building a full-stack Embodied AI platform across foundation models, data infrastructure, simulation, robotic hardware, and deployment. AGIBOT’s “Three Intelligences in One” architecture integrates Locomotion Intelligence, Interaction Intelligence, and Manipulation Intelligence into a unified embodied system. AGIBOT’s portfolio spans humanoid robots, quadrupeds, dexterous systems, and commercial cleaning solutions. In March 2026, AGIBOT announced that its 10,000th robot had rolled off the production line.