MiniMax

预训练数据 Pipeline 工程师

MiniMax  •  Onsite  •  1 day ago
Apply
AI can make mistakes so check important info. Chat history is never stored.

Job Description

预训练数据 Pipeline 工程师
北京、上海
社招
全职
研发 - 数据挖掘
职位描述
为什么加入我们
1. 你会直接参与大模型训练前最核心的数据生产链路,数据质量、吞吐和覆盖度会影响模型能力上限。
2. 这里不是传统离线数仓,而是面向预训练数据构建的大规模分布式数据基础设施。
3. 你会在真实海量数据场景中使用 Spark 等分布式计算技术,解决解析、清洗、过滤、去重、质量评估和采样的工程问题。
职位要求
我们在做什么
MiniMax 正在建设面向大模型预训练的数据生产体系,支撑文本、音频、视频、多模态等数据从采集、解析、清洗、过滤、去重、质量评估到数据资产管理的完整链路
这不是普通的数据处理岗位,而是要把海量非结构化数据转化为可训练、可追踪、可评估、可持续供给的高质量预训练数据资产。你会深度参与预训练数据 Pipeline、分布式 计算平台和数据质量体系建设。
你将做什么
1. 设计并实现预训练数据 Pipeline,覆盖数据解析、清洗、过滤、去重、质量评估、分类采样等核心环节。
2. 基于 Spark 构建大规模分布式数据处理任务,优化任务调度、资源使用、吞吐和稳定性。
3. 参与文本、音频、视频及多模态预训练数据处理,开发数据处理、合成、筛选和优化算子。
4. 建设数据质量评估与数据资产管理能力,让数据来源、处理过程、质量指标和样本分布可追踪。
5. 跟踪预训练数据领域前沿方法,探索数据增强、高质量数据筛选、数据去重和分布优化等方案,并落地到生产链路。
我们期待你
基础要求:
1. 本科及以上学历,计算机、数学、人工智能等相关专业,具备扎实的计算机基础和分布式系统理解。
2. 熟练掌握 Python、Java、Go、C++ 中至少一门语言,具备良好的工程实现能力。
3. 熟悉 Spark 技术栈,有大规模数据 Pipeline 构建、性能优化或稳定性治理经验。
4. 对大模型预训练数据、文本/音视频/多模态数据处理有兴趣,愿意深入业务问题。
加分项:
1. 有 Ray、Flink、Kafka、Iceberg、Hudi、Parquet、Arrow 等数据系统实践经验。
2. 有预训练数据清洗、去重、质量评估、数据采样或数据增强经验。
3. 有大模型预训练数据工程或有行业影响力项目经验。
4. 熟悉 AI Coding、CLI、Skills、Agent 工作流,并能用自动化提升研发效率。
投递
MiniMax

About MiniMax

MiniMax is a leading global technology company and one of the pioneers of large language models (LLMs) in Asia. Our mission is to build a world where intelligence thrives with everyone.

MiniMax develops proprietary LLMs across various modalities, including a trillion-parameter MoE model, a speech model with low latency and native support for major Asian languages, and a state-of-the-art text-to-speech and text-to-video models. Experience it now at https://hailuoai.com/

Leveraging these multi-modality general-purpose models, the MiniMax API Platform offers enterprises and developers secure, flexible, and reliable API services, enabling the rapid deployment of AI applications.

Industry
IT & Software
Company Size
51-200 employees
Headquarters
Singapore, SG
Year Founded
2022
Social Media