高性能存储研发工程师
上海、北京
社招
全职
互联网 / 电子 / 网游
职位描述
一、岗位定位 面向大模型训练与推理场景,研发高吞吐、低延迟、高可靠的全闪分布式存储系统,为 Checkpoint、海量训练数据和 KV Cache 提供稳定高效的数据基础设施。 二、你将负责 1. 面向大模型训练与推理场景,设计和研发全闪分布式存储系统。 2. 支撑大规模训练 Checkpoint 的并行保存与快速恢复、Dataloader 海量样本读取,以及 G3/G3.5 专属 KV Cache 的高性能存储与访问。 3. 根据个人技术方向,负责客户端、元数据服务、存储引擎或数据保护等核心模块的设计与研发。 4. 优化 RDMA、NVMe、用户态 IO、零拷贝、异步流水线和 NUMA 感知等关键数据路径。 5. 设计和实现分片、副本、纠删码、缓存一致性、故障接管、数据修复与垃圾回收等核心机制。 6. 建设性能测试、故障注入和全链路观测体系,持续优化系统吞吐、IOPS、尾延迟、CPU 开销和 GPU 利用率。 7. 参与复杂存储问题的性能分析、故障定位与工程优化,推动系统从设计、开发到上线运行的完整交付。
职位要求
三、我们期望你具备 1. 计算机或相关专业本科及以上学历。 2. 熟练掌握 C/C++,熟悉 Linux 系统编程、多线程并发、内存管理、网络和文件IO。 3. 具备分布式文件系统、对象存储、块存储、数据库或分布式 KV 系统研发经验。 4. 理解分片、复制、纠删码、共识、事务、幂等和故障恢复等分布式系统机制。 5. 具备复杂系统的性能分析和问题定位能力,能够独立完成方案设计、编码、测试与优化。 6. 具备良好的工程意识,关注系统的性能、可靠性、可观测性和长期演进。 四、加分项 - 熟悉 RDMA、RoCE / InfiniBand、NVMe、SPDK、io_uring、DPDK 或 GPU Direct Storage。 - 熟悉 POSIX、VFS、用户态文件系统、元数据一致性或高可用架构。 - 有 Ceph、3FS、RocksDB 等分布式存储系统或存储引擎的研发、性能优化及生产实践经验。 - 熟悉 PyTorch、Megatron-LM、DeepSpeed、vLLM、SGLang 等大模型训练与推理框架。 - 有大模型训练、推理或 AI 基础设施相关存储项目经验。
投递

MiniMax is a leading global technology company and one of the pioneers of large language models (LLMs) in Asia. Our mission is to build a world where intelligence thrives with everyone.
MiniMax develops proprietary LLMs across various modalities, including a trillion-parameter MoE model, a speech model with low latency and native support for major Asian languages, and a state-of-the-art text-to-speech and text-to-video models. Experience it now at https://hailuoai.com/
Leveraging these multi-modality general-purpose models, the MiniMax API Platform offers enterprises and developers secure, flexible, and reliable API services, enabling the rapid deployment of AI applications.