中文

好莱坞镇:基于跨模态多智能体编排的长视频生成

多智能体系统 2025-10-28 v1 计算机视觉与模式识别

摘要

近期的多智能体系统研究在提升创意任务性能方面展现出巨大潜力,如长视频生成。本研究引入三项创新以提升多智能体协作效果。第一,我们提出 OmniAgent——一种基于层次化图结构的多智能体框架,借鉴电影制作的架构,实现模块化专业化与可扩展的智能体间协作。第二,灵感来源于上下文工程,我们提出超图节点,使缺乏足够上下文的智能体可进行临时小组讨论,从而降低单体记忆需求,同时确保充足的上下文信息。第三,我们从有向无环图(DAG)转向具有有限重试次数的有向循环图,使智能体能够迭代反思与优化输出,通过后续节点的反馈改进前期表现。这些贡献为开发更健壮的创意任务多智能体系统奠定了基础。

关键词

引用

@article{arxiv.2510.22431,
  title  = {Hollywood Town: Long-Video Generation via Cross-Modal Multi-Agent Orchestration},
  author = {Zheng Wei and Mingchen Li and Zeqian Zhang and Ruibin Yuan and Pan Hui and Huamin Qu and James Evans and Maneesh Agrawala and Anyi Rao},
  journal= {arXiv preprint arXiv:2510.22431},
  year   = {2025}
}