AGIBOT

AI算力平台项目经理(AI Infra方向)

AGIBOT  •  Onsite  •  3 hours ago
Apply
AI can make mistakes so check important info. Chat history is never stored.

Job Description

AI算力平台项目经理(AI Infra方向)

上海

全职

职位描述

  1. 大型 AI 基础设施端到端项目全生命周期管理 负责智算集群扩建、云原生训推平台、灵枢推理引擎、云边协同底座、算力调度门户等核心技术项目统筹;输出 WBS、里程碑、排期、验收标准、风险台账,保障项目按期高质量交付。 承接算法团队、具身机器人业务侧算力需求,将业务诉求拆解为可落地的基础设施技术方案,组织 PoC 验证、方案评审、压测验收。 管理并行多线技术项目,平衡算力采购、平台迭代、线上稳定性、研发成本,识别关键路径、阻塞依赖,推动跨团队闭环解决。 2. 跨职能复杂协同(TPM 核心价值) 内部协同:硬件机房、网络存储、内核驱动、云原生 K8s、CUDA 算子优化、SRE 运维、算法训练、推理、仿真、安全、财务采购多团队对齐;主导周 / 双周技术同步、风险复盘、事后根因分析。 外部协同:NVIDIA / 国产算力厂商、IDC 机房、液冷供应商、网络设备厂商、存储服务商;跟进硬件交付、固件适配、现场上架调试、集群联调全流程。 向上同步:输出管理层周报 / 月报、项目健康度看板、算力容量预测、投入产出分析,汇报重大风险、资源缺口、扩容规划。 3. 智算容量规划、算力成本与 FinOps 管控 基于大模型训练、批量仿真、人形机器人云边推理流量做中长期算力容量预测,输出季度 / 年度 GPU 采购、机房扩容规划。 搭建算力利用率、MFU、任务排队时延、存储占用、公网带宽消耗、集群故障率核心指标体系;推动闲置算力回收、MIG 切分、弹性调度、错峰任务等降本方案落地。 建立算力计量、租户配额、项目成本分摊机制,输出成本分析报告,支撑预算与采购决策。 4. 平台工程化流程、标准与 SOP 沉淀 搭建集群交付、容器镜像发布、模型下发、故障应急、变更管理标准化流程;完善 CI/CD、集群部署、上线变更规范,降低线上故障 MTTR。 沉淀智算集群交付、异构算力纳管、云边协同、推理引擎迭代项目管理模板,形成可复用项目交付方法论。 推动线上稳定性治理:主导重大故障复盘,输出改进项并跟踪闭环,持续提升集群 SLA(训练集群 99.9%、推理服务 99.95%)。 5. 异构 AI 底座专项技术项目推进 统筹 GPU Operator、Kubeflow 训推流水线、FlashInfer/DeepGEMM 算子编译、ccache 编译缓存、灵枢推理引擎、机器人外设统一调度等底层平台专项迭代。 跟进新硬件(Blackwell/Drive Thor、国产 NPU)适配项目,统筹驱动、内核、通信库、框架全栈联调与性能验收。 推进云边协同体系落地:云端智算集群 + 边缘人形机器人统一管控、模型增量下发、多模态采集数据回流全链路项目落地。

职位要求

硬性基础要求 本科及以上计算机 / 电子 / 自动化相关专业,3-5 年技术项目管理 TPM 经验;有AI 智算集群、GPU 训练 / 推理平台、云原生 K8s项目管理完整经验。 具备大型跨团队项目统筹能力,独立主导过百人级、多模块并行的基础设施交付项目,完整走完需求 - 研发 - 测试 - 上线 - 运维闭环。 熟练使用项目管理工具:Jira、Confluence、飞书项目 / 禅道;具备完整风险管控、里程碑、验收交付实战经验。 技术能力核心(AI Infra TPM 区分普通 PM 关键) 精通 AI 智算基础架构:熟悉 GPU 集群、RoCE 高速网络、分布式存储、液冷机房部署流程;了解 HPC、千卡集群交付全流程风险点。 掌握云原生底座核心栈:Docker、K8s、CSI 存储、CNI 网络、RBAC、DaemonSet/StatefulSet、GPU Operator、Volcano 调度器、KServe 推理框架。 懂大模型训推基础流程:PyTorch 分布式训练、模型并行、量化加速、vLLM/Triton 推理、HF 模型下载、算子编译流程;能看懂基础性能指标(MFU、AllReduce 时延、推理 P99 时延)。 具备基础 Linux 运维认知,能看懂集群监控、故障日志,可独立组织压测、性能调优专项评审。 了解具身智能场景加分:Isaac Sim 仿真、ROS2 机器人、云边协同、多模态传感器数据流。 软素质 极强跨部门推动、冲突协调能力,面对多方诉求可做技术与业务平衡取舍; 强风险预判能力,能提前识别算力交付延迟、硬件兼容、线上稳定性、成本超支等风险并制定缓解方案; 数据驱动思维,擅长搭建指标看板、通过量化数据定位瓶颈,输出可落地优化方案; 优秀文档、汇报能力,可独立输出架构方案、项目报告、管理层汇报材料; 抗压,可同步管理多个并行大型基建项目,适应 AI 业务快速迭代节奏。 三、优先加分项 有千卡 / 万卡智算中心建设、IDC 机房交付、NVIDIA 超算集群项目 TPM 经验; 具备 SRE、后端开发、运维、HPC 技术背景转 TPM; 熟悉大模型训练、推理优化、算子库(CUTLASS/FlashInfer)、推理引擎开发流程; 有 FinOps 算力成本治理、云边一体化平台、人形机器人云平台项目经验; 持有 PMP、ACP 项目管理证书。

投递

AGIBOT

About AGIBOT

AGIBOT is an Embodied AI foundation model company developing both the intelligence layer and the corresponding robotic embodiments needed to bring general intelligence into the physical world. Founded in 2023, AGIBOT is building a full-stack Embodied AI platform across foundation models, data infrastructure, simulation, robotic hardware, and deployment. AGIBOT’s “Three Intelligences in One” architecture integrates Locomotion Intelligence, Interaction Intelligence, and Manipulation Intelligence into a unified embodied system. AGIBOT’s portfolio spans humanoid robots, quadrupeds, dexterous systems, and commercial cleaning solutions. In March 2026, AGIBOT announced that its 10,000th robot had rolled off the production line.

Industry
Manufacturing & Production
Company Size
201-500 employees
Headquarters
Shanghai, CN
Year Founded
Unknown
Social Media