Sharpa

资深 AI Infra 工程师

Sharpa  •  Onsite  •  49 minutes ago
Apply
AI can make mistakes so check important info. Chat history is never stored.

Job Description

资深 AI Infra 工程师

上海

全职

智能制造 / 工业互联网 / 工业自动化

职位描述

负责公司多云 GPU 资源与大规模计算集群的架构设计、建设及运维优化,覆盖训练、微调、推理和端侧算力场景,持续提升算力资源效率、平台稳定性与交付效率。 1. 负责多云 GPU 资源及大规模计算集群的总体架构设计、容量规划、建设与日常运维,建立统一的资源盘点、环境交付和运维标准。 2. 优化训练、微调和推理任务的资源调度,包括队列与配额、优先级、弹性扩缩容及空闲资源回收,提升 GPU 有效使用率和任务交付效率。 3. 建设 GPU 集群的自动化运维能力,覆盖节点初始化、驱动与容器运行环境、版本升级、故障定位、巡检及变更管理。 4. 建立资源与成本可观测体系,持续分析 GPU 使用情况、任务排队时间、故障率和单位任务成本,推动跨云资源选型与成本优化。 5. 与算法、研发及业务团队协作,解决分布式训练、推理服务在计算、网络、存储和调度方面的瓶颈;牵头重大故障复盘和平台改进。 6. 完善权限隔离、资源治理、监控告警、应急预案和技术文档,提升平台稳定性与自助使用体验。 7. 负责端侧算力方案的可观测性建设与优化,建立算力利用率、任务时延、吞吐、功耗及稳定性等指标体系,联动端侧研发定位资源与部署瓶颈,推动端云协同优化。

职位要求

  1. 具备 7 年以上基础设施、云平台或 SRE 相关经验,具有大规模计算集群的架构设计、容量规划、建设与生产运维经验,能够独立解决复杂故障与性能瓶颈。 2. 深入理解 Linux、容器及 Kubernetes,熟悉 GPU 驱动、CUDA 运行环境、设备插件、节点管理和常见故障排查。 3. 有至少一种 GPU 任务调度或计算平台的实践经验,能针对训练与推理负载设计资源池、队列、配额和弹性策略。 4. 熟悉主流云平台的计算、网络、存储及计费机制,有多云资源治理或大规模云资源优化经验;能够在成本、容量和稳定性之间做出合理权衡。 5. 熟练使用 Python、Go 等至少一种语言开发自动化工具,具备基础设施即代码、监控告警和持续交付实践。 6. 具备较强的架构设计、复杂问题排查和跨团队推动能力,能够独立负责从方案设计到上线运营的完整闭环。 7. 熟练使用 AI 工具提升研发与运维效率,能够结合实际场景完成问题分析、脚本编写、知识检索和自动化流程设计,并具备对 AI 生成结果进行验证的能力。 8. 具备端侧算力方案的观测与优化能力,能够建立端侧设备资源、任务性能和稳定性的指标体系,定位算力利用率、时延、功耗等瓶颈,并推动部署或调度策略优化。 加分项 - 有大规模分布式训练经验,熟悉高速网络、共享存储、NCCL 等相关性能问题。 - 熟悉 Kueue、Slurm 等批任务调度体系,或 GPU 共享、MIG 等资源细分方案。 - 曾主导 GPU 利用率提升、跨云迁移或云成本优化项目,并能说明改进前后的衡量方法与结果。 - 有内部开发者平台、自助资源申请平台或 AI 平台产品化经验。 - 有 AI 智能体(Agent)建设经验,或将 AI 应用于监控告警、故障定位、知识库检索、自动化处置等运维场景的实践经验。

投递

Sharpa

About Sharpa

Sharpa is an AI robotics company dedicated to developing ultra-high performance robots and core components, unlocking the limitless possibilities of future general-purpose robotic applications.

Industry
Architecture & Engineering
Company Size
11-50 employees
Headquarters
Singapore, SG
Year Founded
Unknown
Social Media