大模型算法工程师(多模态)-校招【27届】
职位描述
1.负责多模态大模型(MLLM)在汽车垂类场景的端到端落地,覆盖智能导购、车辆视觉理解、智能客服等公司级核心产品功能;
2.构建图文融合的多模态理解与生成系统,实现车辆识别、配置解读、车况评估、跨模态检索等核心能力;
3.探索并应用视觉指令微调(Vision Instruction Tuning)、多模态思维链(Multimodal CoT)、视觉 Grounding 等机制,提升模型在复杂购车咨询、车型对比、故障诊断等高阶推理任务中的表现;
4.参与多模态大模型的数据构建与优化链路,包括图文对数据清洗、高质量指令数据构建、偏好对齐(RLHF/DPO for MLLM);
5.与产品、工程、业务团队紧密协作,推动算法模型从实验到上线的全链路工程化落地,并建立科学的效果评估与迭代机制。
职位要求
1.计算机、人工智能、自动化、数学或相关专业,硕士及以上学历;
2.扎实的机器学习与计算机视觉理论基础,深入理解 Transformer 架构及主流多模态大模型(如 LLaVA、Qwen-VL、DeepSeek-VL、GPT-4V、Gemini 等)的训练与推理机制;
3.具备完整的多模态模型应用落地经验,熟悉 Prompt Engineering、视觉指令微调(Vision SFT)、图文对齐(Contrastive Learning / CLIP 类方法)等技术路径,并有实际项目验证效果;
4.对多模态技术栈有实践积累,包括但不限于:视觉编码器(ViT/SigLIP 等)、图文对齐与融合、多模态指令跟随、OCR 与文档理解、视频理解、跨模态检索与生成;
5.熟练掌握 Python,具备良好的工程实现与系统设计能力,了解服务端部署、模型监控与 AB 测试流程;
6.精通 PyTorch 等深度学习框架,了解分布式训练、推理加速(vLLM/TensorRT-LLM 等)、模型量化等优化技术;
7.具备优秀的逻辑思维、业务抽象能力与跨团队协作意识,能将复杂用户需求转化为可量化的技术方案。
加分项(优先考虑)
1.有垂直领域(汽车、电商、客服等)多模态大模型或视觉理解落地经验;
2.在 CVPR、ICCV、NeurIPS、ICML、ACL、EMNLP 等顶会发表过多模态、视觉理解或大模型相关论文;
3.熟悉多模态指令微调、视觉 RLHF、多模态 Agent 等前沿方向;
参与过开源多模态框架(如 LLaVA、HuggingFace Transformers、MMEngine 等)的二次开发或优化;
4.具备多模态大模型评估体系设计经验,尤其在图文一致性、视觉理解准确率、指令跟随度等维度有方法论沉淀。
投递