Dcar

多模态大模型专家-懂车帝

Dcar  •  Onsite  •  4 hours ago
Apply
AI can make mistakes so check important info. Chat history is never stored.

Job Description

多模态大模型专家-懂车帝

北京

社招

全职

职位 ID:A165498

职位描述

1.多模态大模型在汽车垂类场景的端到端落地:负责多模态大模型(MLLM)在懂车帝核心业务中的研发与应用,覆盖智能导购、车辆视觉理解、智能客服、车况评估、跨模态检索等公司级产品功能,推动算法模型从实验到上线的全链路工程化落地; 2.多模态理解与生成系统构建:构建图文融合的多模态理解与生成系统,实现车辆识别、配置解读、外观 / 内饰细粒度理解、车况图文评估、视频理解与摘要等核心能力,持续提升模型在汽车垂类场景下的理解精度与生成质量; 3.多模态模型训练与对齐:探索并应用视觉指令微调(Vision Instruction Tuning)、多模态思维链(Multimodal CoT)、视觉 Grounding 等机制,提升模型在复杂购车咨询、车型对比、故障诊断等高阶推理任务中的表现;参与多模态数据构建与优化链路,包括图文对数据清洗、高质量指令数据构建、偏好对齐(RLHF/DPO for MLLM); 4.多模态 Agent 与智能交互:设计并开发基于多模态大模型的 Agent 系统,实现图文混合输入下的多轮对话、意图理解、工具调用与自主规划能力,赋能智能导购、AI 搜索等 C 端交互场景,提升用户任务完成率与体验; 5.模型评测与迭代机制建设:建立科学的多模态效果评估体系(涵盖图文一致性、视觉理解准确率、指令跟随度等维度),搭建自动化评测与线上 AB 测试链路,持续驱动模型迭代优化; 6.跨团队协同与业务落地:与产品、工程、业务团队紧密协作,配合版本规划完成开发上线,快速响应线上效果调优与稳定性追查需求,将复杂业务需求转化为可量化的技术方案。

职位要求

1.计算机、人工智能、自动化、数学或相关专业,硕士及以上学历(本科 + 强项目经验亦可); 2.扎实的机器学习与计算机视觉理论基础,深入理解 Transformer 架构及主流多模态大模型(如 LLaVA、Qwen-VL、DeepSeek-VL、GPT-4V、Gemini 等)的训练与推理机制; 3.具备多模态模型应用落地经验,熟悉 Prompt Engineering、视觉指令微调(Vision SFT)、图文对齐(Contrastive Learning / CLIP 类方法)等技术路径,并有实际项目验证效果; 4.对多模态技术栈有实践积累,包括但不限于:视觉编码器(ViT/SigLIP 等)、图文对齐与融合、多模态指令跟随、OCR 与文档理解、视频理解、跨模态检索与生成; 5.熟练掌握 Python,精通 PyTorch 等深度学习框架,了解分布式训练、推理加速(vLLM/TensorRT-LLM 等)、模型量化等优化技术,具备良好的工程实现与系统设计能力; 6.优秀的逻辑思维、业务抽象能力与跨团队协作意识,能将复杂用户需求拆解为可落地的技术方案。 加分项 1.有垂直领域(汽车、电商、客服等)多模态大模型或视觉理解落地经验; 2.在 CVPR、ICCV、NeurIPS、ICML、ACL、EMNLP 等顶会发表过多模态、视觉理解或大模型相关论文; 3.熟悉多模态 Agent、视觉 RLHF、多模态指令微调等前沿方向,参与过开源多模态框架(如 LLaVA、HuggingFace Transformers、MMEngine 等)的二次开发或优化; 4.具备大规模线上 C 端业务(智能导购、AI 搜索、Chatbot 等)的多模态算法落地经验; 5.有大模型领域后训练(SFT/RLHF/RLAIF)全流程实操经验,或有开源社区影响力。

投递

Dcar

About Dcar

Industry
Unknown
Company Size
Unknown
Headquarters
Unknown
Year Founded
Unknown
Social Media
Unknown