基于误差检测和局部细化的自纠正文本到视频生成
计算机视觉与模式识别
2026-04-21 v3 人工智能
计算与语言
摘要
近期的文本到视频 (text-to-video, T2V) 扩散模型在生成高质量视频方面取得了显著进展。然而,它们往往在与复杂文本提示对齐方面存在挑战,尤其是在指定多个对象、属性或空间关系时。我们引入 VideoRepair,这是第一个自纠正的、无需训练的、模型无关的视频细化框架,能够自动检测细粒度的文本-视频误差并执行有针对性的局部纠正。我们的关键洞察是,即使存在误差的视频通常包含应该被保留而非重新生成的正确生成区域。基于这一观察,VideoRepair 提出了一种新颖的区域保留细化策略,包含三个阶段:(i) 误差检测,通过 MLLM 基于自动生成的评估问题进行评估以识别误差区域;(ii) 细化规划,保留正确生成的实体,跨帧分割其区域并为误差区域构建针对性提示;(iii) 局部细化,对问题区域进行选择性再生成,同时通过保留区域和新生成区域的联合优化来保持忠实内容。在两个基准测试中,EvalCrafter 和 T2V-CompBench 上使用四个最新的 T2V 主干模型上,VideoRepair 在各种对齐指标上显著优于最近的基线方法。进一步的全面消融实验进一步证明了该框架的效率、鲁棒性和可解释性。
关键词
引用
@article{arxiv.2411.15115,
title = {Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement},
author = {Daeun Lee and Jaehong Yoon and Jaemin Cho and Mohit Bansal},
journal= {arXiv preprint arXiv:2411.15115},
year = {2026}
}
备注
Accepted to ACL 2026 Findings. Project page: https://video-repair.github.io