VAST

SRE工程师

VAST  •  Beijing, CN (Onsite)  •  2 hours ago
Apply
AI can make mistakes so check important info. Chat history is never stored.

Job Description

SRE工程师

Beijing

Experienced

Outsourced

Responsibilities

Vast 是一家专注于 3D AI 的独角兽公司,致力于构建能够理解和生成 3D 世界的基础模型。公司获得 NVIDIA、Lux Capital 等顶级机构投资,产品覆盖 3D 内容生成、机器人仿真训练、空间计算等前沿领域。SRE 团队是支撑这一切稳定运转的基础——你将直接参与构建服务于大规模 3D AI 模型训练与推理的基础设施体系。 职位要求 1、设计并维护 AWS / 阿里云的多账号体系(Organization / Landing Zone),规划账号结构与边界,制定并落地 IAM 权限策略,推行最小权限原则,管理角色、策略与 SCP 2、建立云资源全生命周期管理规范,包括 Tagging 标准、资源审计与清理流程,推动 FinOps 实践:成本归因、预算告警、RI / SP 购买策略、Spot 实例优化 3、通过 IaC 工具(Terraform 等)实现权限与资源的代码化管理,设计并维护混合云网络架构:VPC 规划、跨区域 / 跨云互联、VPN / 专线配置 4、负责 EKS / ACK 等托管 Kubernetes 集群的搭建、升级与日常运维,管理计算(EC2 / ECS)与存储(S3 / OSS / EBS / NAS)资源的选型、配置与调优,承接 AI 训练与推理工作负载的基础设施交付,保障服务稳定运行 5、处理复杂故障排查:网络不通、性能劣化、服务中断等场景的系统性定位与修复,设计并开发内部 CMDB 系统:资源数据建模、关系拓扑管理、自动发现与同步 6、搭建和维护 CI/CD 流水线,覆盖从代码提交到生产部署的完整交付流程,基于 ArgoCD / GitOps 实现声明式持续部署,管理多环境(dev / staging / prod)交付 7、开发自动化运维工具,提升团队工程效率,维护 Git 工作流规范,推动代码审查与分支管理最佳实践 8、构建并维护公司级可观测性体系,覆盖 Metrics、Logs、Traces 三大支柱,设计监控采集架构,管理 Prometheus / VictoriaMetrics 指标链路 9、搭建日志采集与存储链路(Fluent Bit → Loki / Elasticsearch),落地分布式追踪方案(OpenTelemetry / Jaeger),支持服务间链路分析 10、制定告警策略:分级告警、降噪规则、On-Call 流程与 Runbook 编写,覆盖网络、节点、容器、应用层的全栈监控,参与故障快速定位与复盘

Qualifications

职位要求 1、精通 IAM 权限模型,具备多账号规划与落地经验,熟悉云资源生命周期管理,能制定 Tagging 规范和资源审计流程,有 FinOps 实践经验:成本归因、预算告警、RI/SP 采购、Spot 实例管理 2、了解 Terraform / CloudFormation,能通过代码管理权限与资源,有良好的安全意识,理解合规要求与云安全基线并且精通云网络架构:VPC 设计、跨区域互联、安全组与 ACL 策略 3、有 EKS / ACK 等托管 Kubernetes 集群的搭建与运维经验,熟悉计算和存储服务的选型与调优,具备系统性问题排查能力,掌握常用工具(tcpdump、strace、perf 等) 4、熟练使用 Linux,具备扎实的网络基础知识,有 CMDB 系统设计或开发经验,理解资源建模、关系拓扑等核心概念 5、熟练使用 Jenkins / GitLab CI / GitHub Actions 搭建 CI/CD 流水线,熟悉 ArgoCD / Flux 等 GitOps 工具,能实现声明式持续部署 6、掌握至少一门后端语言(Go / Python / Java),有 API 设计与开发经验,熟悉 Git 工作流、分支策略及代码审查流程 7、精通 Prometheus / VictoriaMetrics / Thanos 指标采集与存储方案,熟悉日志采集链路:Fluentd / Fluent Bit / Vector → Elasticsearch / Loki 8、有分布式追踪(Jaeger / Tempo / OpenTelemetry)落地经验,具备告警体系设计能力:分级、降噪、On-Call 流程、Runbook 编写 9、熟悉云网络与基础设施监控,能设计全栈监控方案 加分项 1、同时具备 AWS 和阿里云的实操经验,有 SCP / Permission Boundary 等高级权限控制经验,使用过 CUR / Cost Explorer / 阿里云费用中心做深度成本分析 2、了解 GPU 实例的采购与调度策略,有 OPS AI Agent 建设经验,善于利用 AI 工具提效,熟悉 MCP、Skill 等协议加分 3、有 GPU 集群(A100 / H100)运维经验,了解 RDMA / InfiniBand 网络,熟悉大规模分布式存储或高性能文件系统 4、有混合云 / 多云网络互联的实际落地经验,持有 AWS SAA / SAP 或阿里云 ACP 认证 5、有 OPS AI Agent 建设经验,善于利用 AI 工具提效,熟悉 MCP、Skill 等协议加分,有自研运维平台或内部开发者门户(IDP)的经验 6、熟悉云资源 API,能实现资源自动同步与状态管理,了解 Backstage / Port 等平台工程工具,有 Kubernetes Operator 开发经验 7、有 OPS AI Agent 建设经验,善于利用 AI 工具提效,熟悉 MCP、Skill 等协议加分,有 GPU 监控经验(DCGM Exporter、GPU 利用率与显存监控) 8、熟悉 Grafana,能构建复杂 Dashboard 与可视化方案,有 AIOps / 智能告警降噪相关经验,了解 SLI / SLO 体系并有实际落地经验

Apply

VAST

About VAST

We are creating immersive interactive communities based on AI-generated 3D technology, aiming to co-create the next generation of content and interaction experiences.

Industry
IT & Software
Company Size
11-50 employees
Headquarters
Hong Kong, HK
Year Founded
2023
Social Media