中文

基于复杂文本对齐与运动感知一致性的内容丰富的AIGC视频质量评估

计算机视觉与模式识别 2025-02-07 v1

摘要

下一代视频生成模型如\textit{Sora}的出现给AI生成内容(AIGC)视频质量评估(VQA)带来了挑战。这些模型显著减轻了先前模型中普遍存在的闪烁伪影,能够处理更长、更复杂的文本提示,并生成具有复杂、多样运动模式的更长视频。为简单文本和基本运动模式设计的传统VQA方法难以评估这些内容丰富的视频。为此,我们提出了\textbf{CRAVE}(\underline{C}ontent-\underline{R}ich \underline{A}IGC \underline{V}ideo \underline{E}valuator),专门用于评估Sora时代的AIGC视频。CRAVE提出了多粒度文本-时序融合,将长文本的复杂语义与视频动态对齐。此外,CRAVE利用混合运动保真度建模来评估时序伪影。此外,鉴于当前AIGC VQA数据集中提示和内容较为简单,我们引入了\textbf{CRAVE-DB},这是一个包含来自下一代模型的内容丰富视频及详细提示的基准数据集。大量实验表明,所提出的CRAVE在多个AIGC VQA基准上取得了优异的结果,显示出与人类感知的高度一致性。所有数据和代码将在https://github.com/littlespray/CRAVE上公开。

关键词

引用

@article{arxiv.2502.04076,
  title  = {Content-Rich AIGC Video Quality Assessment via Intricate Text Alignment and Motion-Aware Consistency},
  author = {Shangkun Sun and Xiaoyu Liang and Bowen Qu and Wei Gao},
  journal= {arXiv preprint arXiv:2502.04076},
  year   = {2025}
}