中文

面向多媒体内容生成的通用多模态智能体

计算机视觉与模式识别 2026-01-07 v1

摘要

随着 AIGC(AI 生成内容)技术的不断进步,越来越多的生成模型正在革新视频编辑、音乐生成乃至电影制作等领域。然而,由于当前 AIGC 模型的局限性,大多数模型只能作为特定应用场景下的独立组件,无法在实际应用中实现端到端任务完成。在实际应用中,编辑专家常常需要处理多种类型的图像和视频输入,生成包含音频、文本等多种元素的多模态输出。这种跨多模态的深度集成是当前模型难以实现的。然而,基于智能体的系统的兴起,使得使用 AI 工具来解决复杂内容生成任务成为可能。为应对复杂场景,本文提出了名为 MultiMedia-Agent 的多媒体智能体,以实现复杂内容的自动化创建。我们的智能体系统包括数据生成管道、内容创建工具库以及用于评估偏好对齐的指标体系。值得注意的是,我们引入技能获取理论来建模训练数据 curated 与智能体训练。我们设计了包含自相关和模型偏好相关性的两阶段关联策略,用于计划优化。此外,我们利用生成的计划通过包括基础/成功计划微调和偏好优化三个阶段来训练 MultiMedia-Agent。比较结果表明,我们的方法有效且 MultiMedia-Agent 能生成更优的多媒体内容。

关键词

引用

@article{arxiv.2601.03250,
  title  = {A Versatile Multimodal Agent for Multimedia Content Generation},
  author = {Daoan Zhang and Wenlin Yao and Xiaoyang Wang and Yebowen Hu and Jiebo Luo and Dong Yu},
  journal= {arXiv preprint arXiv:2601.03250},
  year   = {2026}
}