面向AI生成视频质量评估的多层级语义感知模型
计算机视觉与模式识别
2025-01-07 v1
摘要
扩散模型的快速发展最近在长度和一致性方面极大地推动了AI生成视频的发展,然而评估AI生成视频仍然具有挑战性。以往的方法通常关注用户生成内容(UGC),但很少有专门针对AI生成视频质量评估的方法。在这项工作中,我们引入了MSA-VQA,一种用于AI生成视频质量评估的多层级语义感知模型,它利用了基于CLIP的语义监督和交叉注意力机制。我们的层级框架在三个层次上分析视频内容:帧、片段和视频。我们提出了一个提示语义监督模块,使用CLIP的文本编码器来确保视频与条件提示之间的语义一致性。此外,我们提出了语义突变感知模块来捕捉帧之间的细微变化。大量实验表明,我们的方法达到了最先进的结果。
引用
@article{arxiv.2501.02706,
title = {Multilevel Semantic-Aware Model for AI-Generated Video Quality Assessment},
author = {Jiaze Li and Haoran Xu and Shiding Zhu and Junwei He and Haozhao Wang},
journal= {arXiv preprint arXiv:2501.02706},
year = {2025}
}