SRE与可观测平台工程师
上海
全职
职位描述
负责智元具身智能AI云平台的可靠性与可观测建设,覆盖控制面、计算、存储、网络及训练服务。可按可靠性工程或可观测研发方向应聘,任职要求中的方向项满足其一即可,入职后按专长分工。 主要职责 1. 建设统一指标、日志和链路追踪能力,规范服务及资源标识,关联控制面、算力、存储与训练任务信息,支持跨组件排障。 2. 与服务负责人制定SLI、SLO和告警规则,建设告警分级、聚合、抑制与路由机制,持续改进告警有效性和响应效率。 3. 建设CI/CD、GitOps及配置管理流程,完善变更检查、灰度发布与回滚能力,协同服务团队验证发布和恢复方案。 4. 按团队安排参与值班与应急响应,组织协同排障和故障复盘,维护操作手册及恢复预案,跟进根因修复和改进措施。 5. 建设容量、资源利用率及成本可视化能力,识别容量风险和资源浪费,联合计算、存储等团队推动扩容与使用效率优化。 6. 开发巡检、部署验收和故障诊断工具,联合服务负责人开展故障切换及恢复演练,推动重复操作自动化和可靠性问题闭环。 承担主要目标/关键任务 1. 建设统一指标、日志和链路追踪能力,规范服务及资源标识,关联控制面、算力、存储与训练任务信息,支持跨组件排障。 2. 与服务负责人制定SLI、SLO和告警规则,建设告警分级、聚合、抑制与路由机制,持续改进告警有效性和响应效率。 3. 建设CI/CD、GitOps及配置管理流程,完善变更检查、灰度发布与回滚能力,协同服务团队验证发布和恢复方案。 4. 按团队安排参与值班与应急响应,组织协同排障和故障复盘,维护操作手册及恢复预案,跟进根因修复和改进措施。 5. 建设容量、资源利用率及成本可视化能力,识别容量风险和资源浪费,联合计算、存储等团队推动扩容与使用效率优化。 6. 开发巡检、部署验收和故障诊断工具,联合服务负责人开展故障切换及恢复演练,推动重复操作自动化和可靠性问题闭环。
职位要求
任职要求 1. 教育背景:本科及以上学历,计算机、软件工程、网络工程、信息技术等相关专业优先。 2. 工作经验:3年以上SRE、云平台运维或可观测研发经验,具备生产故障处理或平台建设经历;具有5年以上相关经验及可靠性体系建设经验者优先。 3. 熟悉Linux、容器和Kubernetes,能够结合系统指标、日志及网络信息分析常见故障,具备生产问题定位能力。 4. 掌握Python、Go或Shell至少一种语言,能够开发可维护的自动化工具,具备代码管理、测试和技术文档编写习惯。 5. 可靠性方向:熟悉发布、升级和回滚流程,理解SLI、SLO、容量规划及故障复盘,能够推进生产变更与协同排障。 6. 可观测方向:熟悉Prometheus、Grafana或同类工具,具备监控或日志平台建设经验,理解链路追踪与告警治理。 加分项 1. 有GPU集群、训练平台、分布式存储或高性能网络的可靠性保障经验,能定位跨组件故障。 2. 有OpenTelemetry或同类工具实践,具备告警降噪、故障演练或自动化诊断项目经验。
投递

AGIBOT is an Embodied AI foundation model company developing both the intelligence layer and the corresponding robotic embodiments needed to bring general intelligence into the physical world. Founded in 2023, AGIBOT is building a full-stack Embodied AI platform across foundation models, data infrastructure, simulation, robotic hardware, and deployment. AGIBOT’s “Three Intelligences in One” architecture integrates Locomotion Intelligence, Interaction Intelligence, and Manipulation Intelligence into a unified embodied system. AGIBOT’s portfolio spans humanoid robots, quadrupeds, dexterous systems, and commercial cleaning solutions. In March 2026, AGIBOT announced that its 10,000th robot had rolled off the production line.