中文

面向文本到视频质量评估的主观对齐数据集与指标

计算机视觉与模式识别 2024-08-08 v5

摘要

随着生成模型的快速发展,人工智能生成内容(Artificial Intelligence-Generated Contents, AIGC)在日常生活中呈指数级增长。其中,文本到视频(Text-to-Video, T2V)生成受到了广泛关注。尽管已发布许多用于生成高感知质量视频的 T2V 模型,但仍缺乏一种定量评估这些视频质量的方法。为解决此问题,我们构建了迄今为止最大规模的文本到视频质量评估数据库(Text-to-Video Quality Assessment DataBase, T2VQA-DB)。该数据集由 9 个不同 T2V 模型生成的 10,000 个视频组成。我们还开展了一项主观研究,以获取每个视频对应的平均意见分。基于 T2VQA-DB,我们提出了一种新颖的基于 Transformer 的主观对齐文本到视频质量评估(Text-to-Video Quality Assessment, T2VQA)模型。该模型从文本-视频对齐和视频保真度两个角度提取特征,随后利用大语言模型的能力给出预测分数。实验结果表明,T2VQA 优于现有的 T2V 指标和 SOTA 视频质量评估模型。定量分析表明,T2VQA 能够给出主观对齐的预测,验证了其有效性。数据集和代码将发布于 https://github.com/QMME/T2VQA。

关键词

引用

@article{arxiv.2403.11956,
  title  = {Subjective-Aligned Dataset and Metric for Text-to-Video Quality Assessment},
  author = {Tengchuan Kou and Xiaohong Liu and Zicheng Zhang and Chunyi Li and Haoning Wu and Xiongkuo Min and Guangtao Zhai and Ning Liu},
  journal= {arXiv preprint arXiv:2403.11956},
  year   = {2024}
}

备注

Accepted by ACMMM 24