AGAV-Rater:基于大型多模态模型的AI生成音视频质量评估
多媒体
2025-07-15 v2 计算机视觉与模式识别
声音
音频与语音处理
摘要
已提出许多视频到音频 (VTA) 方法用于给静音的AI生成视频配音。对于AI生成的音视频内容 (AGAV) 的高效质量评估方法对于确保音视频质量至关重要。现有的音视频质量评估方法在处理AGAV特有的失真(如不真实且不一致的元素)时难以胜任。为此,我们引入了AGAVQA-3k数据集,首个大规模AGAV质量评估数据集,包含来自16种VTA方法的3382个AGAV。AGAVQA-3k包括两个子集:AGAVQA-MOS提供音频质量、内容一致性和整体质量的多维度评分,AGAVQA-Pair旨在实现最佳AGAV配对选择。我们进一步提出了AGAV-Rater,一个基于LMM的模型,可对AGAV进行评分,以及从文本生成的音频和音乐,并在多个维度上选择由VTA方法生成的最佳AGAV呈现给用户。AGAV-Rater在AGAVQA-3k、Text-to-Audio和Text-to-Music数据集上实现了最先进的性能。主观测试也确认,AGAV-Rater提高了VTA性能和用户体验。数据集和代码可在https://github.com/charlotte9524/AGAV-Rater获取。
引用
@article{arxiv.2501.18314,
title = {AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment},
author = {Yuqin Cao and Xiongkuo Min and Yixuan Gao and Wei Sun and Guangtao Zhai},
journal= {arXiv preprint arXiv:2501.18314},
year = {2025}
}