LMM-VQA:利用大型多模态模型推进视频质量评估
计算机视觉与模式识别
2024-08-27 v1 人工智能
摘要
流媒体平台上视频的爆炸式增长凸显了对有效视频质量评估(VQA)算法的迫切需求,以监控和感知优化流媒体视频的质量。然而,由于视频内容多样且存在复杂的时空失真,VQA仍然是一项极具挑战性的任务,因此需要更先进的方法来解决这些问题。如今,大型多模态模型(LMMs),如GPT-4V,在各种视觉理解任务中展现出强大的能力,这激励我们利用LMMs强大的多模态表示能力来解决VQA任务。因此,我们提出了首个大型多模态视频质量评估(LMM-VQA)模型,该模型引入了一种新颖的时空视觉建模策略用于质量感知特征提取。具体来说,我们首先将质量回归问题重构为问答(Q&A)任务,并构建用于VQA指令微调的问答提示。然后,我们设计了一个时空视觉编码器来提取空间和时间特征以表示视频的质量特性,这些特征随后由时空投影仪映射到语言空间以进行模态对齐。最后,对齐的视觉标记和查询质量的文本标记被聚合作为大型语言模型(LLM)的输入,以生成质量分数和等级。大量实验表明,LMM-VQA在五个VQA基准测试中均达到了最先进的性能,在泛化能力上比现有方法平均提升5%。此外,由于时空编码器和投影仪的先进设计,LMM-VQA在通用视频理解任务上也表现异常出色,进一步验证了其有效性。我们的代码将在https://github.com/Sueqk/LMM-VQA发布。
引用
@article{arxiv.2408.14008,
title = {LMM-VQA: Advancing Video Quality Assessment with Large Multimodal Models},
author = {Qihang Ge and Wei Sun and Yu Zhang and Yunhao Li and Zhongpeng Ji and Fengyu Sun and Shangling Jui and Xiongkuo Min and Guangtao Zhai},
journal= {arXiv preprint arXiv:2408.14008},
year = {2024}
}