中文

VQA²:用于视频质量评估的视觉问答

计算机视觉与模式识别 2024-12-03 v4 人工智能

摘要

大型多模态模型(LMM)的出现和普及为计算机视觉引入了新范式,将各种任务统一为视觉问答框架。视频质量评估(VQA)是低级视觉感知中的经典领域,最初专注于定量视频质量评分。然而,受 LMM 进展的驱动,它正朝着更全面的视觉质量理解任务推进。近期图像领域的研究表明,视觉问答(VQA)可以显著增强低级视觉质量评估。然而,相关工作尚未在视频领域得到探索,留有大量改进空间。为填补这一空白,我们提出了 VQA² 指令数据集——首个专注于视频质量评估的视觉问答指令数据集。该数据集包含 3 个子集,涵盖各种视频类型,包含 157,755 条指令问答对。然后,在此基础上,我们提出了 VQA2 系列模型。VQA2 系列模型交错视觉和运动标记以增强对视频中时空质量细节的感知。我们对视频质量评分和理解任务进行了广泛实验,结果表明 VQA2 系列模型在两个任务中均取得了优异表现。值得注意的是,我们的最终模型 VQA2-Assistant 在视觉质量理解任务上超过了著名的 GPT-4o,同时在质量评分任务中保持了强劲竞争力。我们的工作为将低级视频质量评估和理解与 LMM 集成奠定了基础并提供了可行方案。

关键词

引用

@article{arxiv.2411.03795,
  title  = {VQA$^2$: Visual Question Answering for Video Quality Assessment},
  author = {Ziheng Jia and Zicheng Zhang and Jiaying Qian and Haoning Wu and Wei Sun and Chunyi Li and Xiaohong Liu and Weisi Lin and Guangtao Zhai and Xiongkuo Min},
  journal= {arXiv preprint arXiv:2411.03795},
  year   = {2024}
}

备注

23 pages 12 figures