基于多模态大语言模型的短片视频质量评估集成方法
计算机视觉与模式识别
2024-12-25 v1
摘要
短片视频的兴起,其内容多样、编辑风格多样且存在诸多伪影,为基于学习的盲视频质量评估 (BVQA) 模型带来了重大挑战。多模态大语言模型 (MLLM) 凭借其卓越的泛化能力,成为具有前景的解决方案。本文聚焦于有效地利用预训练 MLLM 进行短片视频质量评估,关注预处理和响应变异的影响,以及将 MLLM 与 BVQA 模型结合的洞见。我们首先研究帧的预处理和抽样技术如何影响 MLLM 的性能。随后,我们引入一种轻量级基于学习的集成方法,自适应地整合 MLLM 和最先进的 BVQA 模型的预测。我们的结果表明,所提出的集成方法在泛化性能方面表现优异。此外,对内容感知集成权重的分析显示,某些视频特征在现有 BVQA 模型中并未得到充分代表,这为进一步改进 BVQA 模型指明了潜在方向。
引用
@article{arxiv.2412.18060,
title = {An Ensemble Approach to Short-form Video Quality Assessment Using Multimodal LLM},
author = {Wen Wen and Yilin Wang and Neil Birkbeck and Balu Adsumilli},
journal= {arXiv preprint arXiv:2412.18060},
year = {2024}
}
备注
Accepted by ICASSP 2025