中文

MSG评分:可靠多场景生成的自动化视频验证

计算机视觉与模式识别 2026-04-09 v2 人工智能

摘要

尽管文本到视频扩散模型取得了显著进展,但创建连贯的长篇内容仍然不可靠,由于随机抽样制造的伪影。这使得生成多个候选者成为必要,但对它们的验证则造成了严重的瓶颈;手动审阅无法实现规模化,而现有的自动化指标缺乏满足运行时监控所需的灵活性和速度。另一个关键问题是评估质量与运行时性能之间的权衡:能够最好地捕捉类人判断的指标往往太慢,以至于无法支持迭代生成。这些挑战源于缺乏有效的评估方法,这促使我们致力于 developing 一个 novel solution。为此,我们提出了一个可扩展的长篇视频自动化验证框架。首先,我们引入了MSG(Multi-Scene Generation)评分,这是一种基于层次注意力的度量,能够适应性地评估叙事和视觉一致性。这作为我们的CGS(Candidate Generation and Selection)框架中的核心验证器,自动识别和过滤高质量输出。此外,我们引入了隐式洞察蒸馏(IID),以解决评估可靠性与推理速度之间的权衡,将复杂度量洞察蒸馏到一个轻量级学生模型中。我们的做法提供了可靠且可扩展的长篇视频制作的第一个全面解决方案。

关键词

引用

@article{arxiv.2411.19121,
  title  = {MSG Score: Automated Video Verification for Reliable Multi-Scene Generation},
  author = {Daewon Yoon and Hyeongseok Lee and Wonsik Shin and Sangyu Han and Nojun Kwak},
  journal= {arXiv preprint arXiv:2411.19121},
  year   = {2026}
}

备注

8 pages, 5 figures, 1 table, Accepted AAAI 2026 CVM workshop