视频AIGC/多模态Agent算法工程师
北京
社招
全职
职位 ID:A166556
职位描述
岗位介绍: 面向视频内容创作场景,探索视频生成、多模态理解与智能体技术,构建从创意理解、脚本分镜、素材生成到视频编辑和质量评估的智能创作能力;我们希望你既关注模型与算法的进展,也愿意解决真实场景中的效果、效率和用户体验问题。 工作职责: 1、负责视频 AIGC、多模态理解或创作 Agent 相关算法与系统研发,承担核心模块的设计、实现和迭代; 2、研发视频生成与编辑能力,探索文生视频、图生视频、参考驱动生成、可控编辑等技术,提升主体一致性、时序连贯性、指令遵循和视听表现; 3、构建面向视频创作的 Agent,研究任务规划、工具调用、上下文与记忆管理、执行反馈和失败恢复,实现多步骤创作任务的可靠执行; 4、建设数据与评测体系,开展数据筛选、合成、标注及模型微调,结合自动评测、人工评价和真实使用反馈定位问题、验证改进; 5、与产品、工程及内容团队协作,推动算法上线,持续优化生成质量、任务成功率、响应时延与推理成本。
职位要求
1、计算机、人工智能、数学、电子信息等相关专业本科及以上学历,或具备同等实践能力; 2、具备扎实的机器学习、深度学习和编程基础,熟练使用 Python,熟悉 PyTorch 等主流深度学习框架; 3、在以下至少一个方向有深入研究或完整项目经验: - 视频/图像生成:熟悉 Diffusion、Flow Matching、DiT 等相关方法,具备训练、微调、可控生成或推理优化经验; - 多模态理解:熟悉视觉语言模型、视频理解、跨模态对齐或时序推理,具备数据构建、模型优化与评测经验; - Agent:具备基于大模型的规划、工具调用、状态管理或执行评测经验,能够分析多步骤任务中的失败原因并改进系统; 4、能够独立完成问题定义、方案设计、实验验证与结果分析,具备良好的工程习惯和可复现实验意识; 5、能够阅读英文技术资料和论文,具备主动学习、跨团队沟通和推动项目落地的能力; 加分项: 6、有视频生成、智能剪辑、数字人、音视频联合建模或创作工具的实际落地经验; 7、有模型后训练、偏好优化、强化学习、奖励模型或多模态评测经验; 8、有分布式训练、模型蒸馏、量化、推理加速或大规模数据处理经验; 9、有高质量论文、开源贡献、技术博客或可体验的产品作品。 投递建议: 欢迎随简历附上项目、代码、论文或 Demo,并简要说明你负责的部分、解决的关键问题及效果验证方式。
投递
