懂车帝 - 评测运营(大模型 / AI 方向)
职位描述
岗位概述
负责懂车帝 AI 大模型业务的评测体系建设与运营,从 0 到 1 搭建各 AI 方向的 Benchmark 评测集,建立标准化评测流程与质量管控机制,通过数据驱动模型效果优化,为算法选型、版本迭代和业务落地提供评测支撑。
岗位职责
1.评测体系建设:负责懂车帝 AI 大模型相关业务的评测体系从 0 到 1 搭建,包括 Benchmark 设计、评测标准制定、评分规则(Rubric)设计、评测流程规范化,覆盖搜索、问答、内容生成、Agent 等核心场景;
2.Benchmark 集搭建:围绕业务目标和真实用户需求,建设覆盖多维度、多场景的评测数据集,设计评测维度与难度分层,保障评测结果的有效性、可比性和可复现性;
3.模型评测与选型:开展不同基座模型、主流大模型及内部模型版本的横向评测与深度选型,综合评估模型效果、业务适配性、安全下限和稳定性,形成模型接入标准与版本准入决策依据;
4.效果诊断与迭代:建立效果诊断与迭代牵引机制,结合得分、GSB、相关性、结果分布及典型 Case 开展问题定位与根因分析,区分模型能力短板、数据问题、Prompt 优化等不同归因,协同算法团队制定优化方案并验证迭代收益;
5.评测资产沉淀:沉淀并运营 Benchmark 核心资产,包括数据集、Rubric、Judge Prompt、评测报告及典型 Case 库,建设统一的评测方法论、建设进度、人机一致性和模型对比结果看板,支持多业务线复用;
6.评测平台与工具:推动评测平台 / 工具的产品化落地,将重复性评测工作沉淀为可复用的工具与标准化流程,打通数据接入、任务配置、自动评测、结果分析、问题回收和版本回归等环节,形成可持续运行的评测闭环;
7.前沿方法跟踪:持续跟踪 LLM-as-a-Judge、成对偏好评测、人机一致性、Agent 任务评测等前沿评测范式,结合业务场景验证并引入适用方法,持续提升 Benchmark 的区分度、有效性和业务相关性。
职位要求
1.本科及以上学历,3 年以上互联网产品运营、数据运营、评测运营或相关经验;
2.有大模型评测、数据标注、Benchmark 建设相关经验,熟悉 LLM 评测方法论与主流评测范式;
3.具备从 0 到 1 搭建评测体系的能力,能独立完成评测标准设计、数据采集与标注、质量管控、平台落地全流程;
4.了解大模型技术原理,熟悉 SFT、RLHF、DPO、多模态等模型训练形式,能与算法团队顺畅沟通需求;
5.具备较强的数据分析能力,能根据评测数据搭建共识数据统计口径,从多角度进行数据产出和监控,定位问题并驱动优化;
6.优秀的跨部门协作与项目管理能力,能协同算法、产品、研发、标注团队高效推进,在多项目并行下把控进度和质量;
7.结果导向,执行力强,能快速捕捉卡点并暴露问题,协调各方资源推动解决。
加分项
1.有汽车行业、内容平台、搜索推荐或垂类社区相关业务经验;
2.有 LLM-as-a-Judge、AI Coding 评测、Agent 评测等前沿评测实践经验;
3.有医学、法律、金融等专业领域的评测 / 质控经验(专业领域评测能力可迁移);
4.有评测平台、标注平台或效率工具的搭建 / 产品化经验。
投递