多维 AI 生成视频质量评估基准:一个数据集和统一模型
计算机视觉与模式识别
2024-12-30 v2
摘要
近年来,人工智能 (AI)驱动的视频生成技术受到广泛关注。因此,对 AI 生成内容 (AIGC) 视频感知质量的准确视频质量评估 (VQA) 指标以满足评估和优化视频生成模型的需求而日益重要。然而,评估 AIGC 视频的质量仍是一个重大挑战,因为这些视频常常表现出高度复杂的失真,如不自然的动作和不理智的物体。为此,我们从主观和客观两个角度系统地调查 AIGC-VQA 问题。就主观角度而言,我们构建了大型生成视频质量评估 (LGVQ) 数据集,包含由 6 个视频生成模型使用 468 个精心策划的文本提示生成的 2,808 个 AIGC 视频。我们从三个关键维度评估 AIGC 视频的感知质量:空间质量、时间质量和文本-视频对齐。就客观角度而言,我们在 LGVQ 数据集上建立了现有质量评估指标的基准。我们的发现表明,当前指标在该数据集上的表现不佳,凸显了有效评估工具之间的差距。为弥合这一差距,我们提出了统一生成视频质量评估 (UGVQ) 模型,旨在准确评估 AIGC 视频的多维质量。UGVQ 模型将视频的视觉特征和运动特征与其相应文本提示的文本特征相结合,形成针对 AIGC 视频的统一质量感知特征表示。实验结果表明,UGVQ 在 LGVQ 数据集上的所有三个质量维度上均实现了最佳性能。LG VQ 数据集和 UGVQ 模型均已公开于 https://github.com/zczhang-sjtu/UGVQ.git。
引用
@article{arxiv.2407.21408,
title = {Benchmarking Multi-dimensional AIGC Video Quality Assessment: A Dataset and Unified Model},
author = {Zhichao Zhang and Wei Sun and Xinyue Li and Jun Jia and Xiongkuo Min and Zicheng Zhang and Chunyi Li and Zijian Chen and Puyi Wang and Fengyu Sun and Shangling Jui and Guangtao Zhai},
journal= {arXiv preprint arXiv:2407.21408},
year = {2024}
}