中文

SCMAPR:面向复杂情景的自纠正多智能体提示优化框架用于文本到视频生成

人工智能 2026-04-21 v4 多智能体系统

摘要

文本到视频 (T2V) 生成受益于扩散模型的最新进展,但当前系统在复杂情景下仍表现不佳,这些情景通常因文本提示的模糊性和不完整性而加剧。在本工作中,我们将复杂情景下的提示优化建模为阶段性多智能体优化过程,提出 SCMAPR,即面向复杂情景的自纠正多智能体提示优化框架,用于 T2V 提示。SCMAPR 协调专用智能体以 (i) 将每个提示路由到基于主题的情景以进行策略选择,(ii) 合成情景感知的重写策略并执行策略条件优化,以及 (iii) 执行结构化语义验证,当检测到违规时触发条件修订。为阐明 T2V 提示中复杂情景的构成标准、提供示范示例并在此类具有挑战性条件下进行严格评估,我们进一步引入 T2V-Complexity,这是一个仅包含复杂情景提示的 T2V 基准数据集。广泛的实验在 3 个现有基准和我们的 T2V-Complexity 基准上表明,SCMAPR 在复杂情景下持续提高文本-视频对齐度和整体生成质量,在 VBench 和 EvalCrafter 上分别实现最高可达 2.67% 和 3.28 的平均得分提升,在 T2V-CompBench 上实现最高可达 0.028 的提升,超过 3 种最先进的基线方法。SCMAPR 的代码已公开发布于 https://github.com/HiThink-Research/SCMAPR。

关键词

引用

@article{arxiv.2604.05489,
  title  = {SCMAPR: Self-Correcting Multi-Agent Prompt Refinement for Complex-Scenario Text-to-Video Generation},
  author = {Chengyi Yang and Pengzhen Li and Jiayin Qi and Aimin Zhou and Ji Wu and Ji Liu},
  journal= {arXiv preprint arXiv:2604.05489},
  year   = {2026}
}