VQQA:一种用于视频评估与质量提升的智能体方法
计算机视觉与模式识别
2026-03-16 v1 人工智能
机器学习
多智能体系统
摘要
尽管视频生成模型取得了快速的进展,但与复杂用户意图的对齐仍然具有挑战性。现有的测试时优化方法通常要么计算代价高,要么需要对模型内部的白盒访问。为此,我们提出了 VQQA(Video Quality Question Answering),一种可通用于多种输入模态和视频生成任务的统一、多智能体框架。通过动态生成视觉问题并利用所得的视觉语言模型(VLM)批评作为语义梯度,VQQA 用人类可解释、可操作的反馈取代传统的被动评估指标。这使其能够通过黑盒自然语言界面实现高度有效的闭环提示优化。广泛的实验表明,VQQA 有效地隔离并解决视觉瑕疵,在仅几步细化步骤中显著提高了生成质量。适用于文本到视频(T2V)和图像到视频(I2V)任务,我们的方法在 T2V-CompBench 上实现了 +11.57% 的绝对提升,在 VBench2 上实现了 +8.43% 的提升,显著优于最先进的随机搜索和提示优化技术。
引用
@article{arxiv.2603.12310,
title = {VQQA: An Agentic Approach for Video Evaluation and Quality Improvement},
author = {Yiwen Song and Tomas Pfister and Yale Song},
journal= {arXiv preprint arXiv:2603.12310},
year = {2026}
}