A$^2$RD:用于长视频一致性的智能体自回归扩散
计算机视觉与模式识别
2026-05-11 v1 人工智能
摘要
合成一致且连贯的长视频仍然是一个基本挑战。现有方法在长时段内会出现语义漂移和叙事崩溃。我们提出了 ARD,一种智能体自回归扩散架构,将创造性合成与一致性强制执行解耦。ARD 将长视频合成表述为一个闭环过程,通过“检索-合成-优化-更新”循环逐段合成并自我改进视频。它包含三个核心组件: 跨模态跟踪视频进展的多模态视频记忆; 在生成模式间切换以实现自然过渡和视觉一致性的自适应片段生成; 在帧级和视频级对每个片段进行自我改进以防止误差传播的分层测试时自我改进。我们进一步引入了 LVBench-C,这是一个具有非线性实体和环境转换的挑战性基准,用于对长时段一致性进行压力测试。在跨越 1 到 10 分钟视频的公开基准和 LVBench-C 基准上,ARD 在一致性方面比最先进的基线高出 30%,在叙事连贯性方面高出 20%。人工评估证实了这些提升,同时也突出了在运动和过渡平滑度方面的显著改进。
引用
@article{arxiv.2605.06924,
title = {A$^2$RD: Agentic Autoregressive Diffusion for Long Video Consistency},
author = {Do Xuan Long and Yale Song and Min-Yen Kan and Tomas Pfister and Long T. Le},
journal= {arXiv preprint arXiv:2605.06924},
year = {2026}
}
备注
Project page: http://dxlong2000.github.io/AARD