资深 AI Infra 工程师
上海
全职
智能制造 / 工业互联网 / 工业自动化
职位描述
负责公司多云 GPU 资源与大规模计算集群的架构设计、建设及运维优化,覆盖训练、微调、推理和端侧算力场景,持续提升算力资源效率、平台稳定性与交付效率。 1. 负责多云 GPU 资源及大规模计算集群的总体架构设计、容量规划、建设与日常运维,建立统一的资源盘点、环境交付和运维标准。 2. 优化训练、微调和推理任务的资源调度,包括队列与配额、优先级、弹性扩缩容及空闲资源回收,提升 GPU 有效使用率和任务交付效率。 3. 建设 GPU 集群的自动化运维能力,覆盖节点初始化、驱动与容器运行环境、版本升级、故障定位、巡检及变更管理。 4. 建立资源与成本可观测体系,持续分析 GPU 使用情况、任务排队时间、故障率和单位任务成本,推动跨云资源选型与成本优化。 5. 与算法、研发及业务团队协作,解决分布式训练、推理服务在计算、网络、存储和调度方面的瓶颈;牵头重大故障复盘和平台改进。 6. 完善权限隔离、资源治理、监控告警、应急预案和技术文档,提升平台稳定性与自助使用体验。 7. 负责端侧算力方案的可观测性建设与优化,建立算力利用率、任务时延、吞吐、功耗及稳定性等指标体系,联动端侧研发定位资源与部署瓶颈,推动端云协同优化。
职位要求
投递

Sharpa is an AI robotics company dedicated to developing ultra-high performance robots and core components, unlocking the limitless possibilities of future general-purpose robotic applications.