AGIBOT

运维架构师

AGIBOT  •  Onsite  •  2 hours ago
Apply
AI can make mistakes so check important info. Chat history is never stored.

Job Description

运维架构师

上海

全职

职位描述

"1、运维架构整体设计:负责大规模GPU集群、IB/RoCE高速网络、分布式存储、调度资源的运维架构规划与迭代,设计高可用运维架构、故障域隔离、容量架构、扩容演进方案,支撑超大规模AI算力集群的持续规模化扩张。 2、运维体系标准化建设:搭建完整的智算集群运维SOP、变更体系、故障治理体系、值班体系、容灾预案,统一运维规范、基线标准、版本标准、巡检标准,实现运维工作体系化、可复制、可规模化。 3、运营系统架构设计:对接内部云管平台、Infra加速团队,设计算力运营、监控观测、资源管理、SLA履约、资产健康管理整体架构,定义数据口径、指标体系、告警体系、可视化大盘架构。 4、集群可运维性优化:针对GPU异构集群、IB/RoCE网络、多机通信、训练任务场景,优化集群可观测性、故障自愈、故障快速定位能力,降低运维压力,提升集群整体可用率与算力利用率。 5、重大技术风险治理:主导P0/P1级集群事故复盘、架构级根因分析,从架构层面解决集群稳定性、网络风暴、通信异常、调度抖动、硬件批量故障等深层次问题,输出架构优化方案落地。 6、履约与SLA架构设计:结合公司算力设备租赁运营模式,设计资产健康管理、硬件生命周期、故障追责、算力可用率履约体系架构,支撑对内自用、对外商用算力的SLA保障。 7、技术团队赋能:指导SRE、集群运维、测试团队的技术方向,输出架构规范、技术标准、运维最佳实践,统一团队技术口径与执行标准。"

职位要求

"1、本科及以上学历,计算机、通信、云计算相关专业,8年以上大规模数据中心/智算中心运维架构经验,具备超大规模GPU集群架构落地经验。 2、精通GPU异构集群、Linux、IB/RoCE高速网络、分布式存储、Slurm/K8s算力调度架构,熟悉大模型训练集群运维特性与痛点。 3、具备大型智算中心运维体系、SLA体系、可观测体系、故障治理体系从零搭建经验,懂规模化运维架构演进逻辑。 4、熟悉算力运营逻辑,理解算力租赁、资产履约、算力可用率、卡时计量、资源隔离等商业化运营架构需求。 5、具备架构设计、方案输出、跨团队推动落地能力,能协同云管开发、Infra、测试、SRE团队完成体系共建。 6、具备极强的稳定性思维、风险预判能力,能够从架构层面解决集群长期稳定性与运营难题。 7、有头部智算中心、云计算厂商、AI大厂集群架构经验者优先。"

投递

AGIBOT

About AGIBOT

AGIBOT is an Embodied AI foundation model company developing both the intelligence layer and the corresponding robotic embodiments needed to bring general intelligence into the physical world. Founded in 2023, AGIBOT is building a full-stack Embodied AI platform across foundation models, data infrastructure, simulation, robotic hardware, and deployment. AGIBOT’s “Three Intelligences in One” architecture integrates Locomotion Intelligence, Interaction Intelligence, and Manipulation Intelligence into a unified embodied system. AGIBOT’s portfolio spans humanoid robots, quadrupeds, dexterous systems, and commercial cleaning solutions. In March 2026, AGIBOT announced that its 10,000th robot had rolled off the production line.

Industry
Manufacturing & Production
Company Size
201-500 employees
Headquarters
Shanghai, CN
Year Founded
Unknown
Social Media