探索AIGC视频质量:聚焦视觉和谐、视频-文本一致性及域分布差距
计算机视觉与模式识别
2024-04-30 v2
摘要
近期文本到视频人工智能生成内容 (AIGC) 的取得令人瞩目。与传统视频相比,AIGC视频质量评估面临诸多挑战:视觉不一致性违背常识、内容与文本提示之间的差异以及不同生成模型之间的分布差距等。针对这些挑战,本文将AIGC视频质量评估分为三个维度:视觉和谐、视频-文本一致性和域分布差距。针对每个维度,我们设计了特定模块以全面评估AIGC视频的质量。此外,本研究确定不同文本到视频模型生成的视频在视觉质量、流畅度和风格方面存在显著差异。预测源生成模型可使AIGC视频特征更具辨识力,从而提升质量评估性能。所提出的方法用于NTIRE 2024质量评估AI生成内容 - Track 2视频赛获第三名,证明了其有效性。代码将在https://github.com/Coobiw/TriVQA 可用。
引用
@article{arxiv.2404.13573,
title = {Exploring AIGC Video Quality: A Focus on Visual Harmony, Video-Text Consistency and Domain Distribution Gap},
author = {Bowen Qu and Xiaoyu Liang and Shangkun Sun and Wei Gao},
journal= {arXiv preprint arXiv:2404.13573},
year = {2024}
}
备注
9 pages, 3 figures, 3 tables. Accepted by CVPR2024 Workshop (3rd place winner of NTIRE2024 Quality Assessment for AI-Generated Content - Track 2 Video)