面向视频质量评估的上下文与像素感知大语言模型
计算机视觉与模式识别
2026-05-12 v4 多媒体
图像与视频处理
摘要
视频质量评估(VQA)是一个具有广泛应用前景的挑战性研究课题。传统的手工特征和基于判别式学习的VQA模型主要关注像素级失真,缺乏上下文理解能力,而近期的多模态大语言模型(MLLMs)则难以对微小失真保持敏感,或将质量评分和描述作为独立任务处理。为解决这些不足,我们提出了CP-LLM:一个上下文与像素感知的大语言模型。CP-LLM是一种新颖的多模态LLM架构,其特点是拥有双视觉编码器,旨在独立分析高层(视频上下文)和低层(像素失真)粒度的感知质量,并配有一个随后对这些方面之间的相互作用进行推理的语言解码器。这种设计使CP-LLM能够同时生成鲁棒的质量分数和可解释的质量描述,并增强了对像素失真(例如压缩伪影)的敏感性。实验结果表明,CP-ADM在VQA基准测试上实现了最先进的跨数据集性能,并对像素失真表现出优越的鲁棒性。
引用
@article{arxiv.2505.16025,
title = {Context and Pixel Aware Large Language Model for Video Quality Assessment},
author = {Wen Wen and Yaohong Wu and Yue Sheng and Neil Birkbeck and Balu Adsumilli and Yilin Wang},
journal= {arXiv preprint arXiv:2505.16025},
year = {2026}
}
备注
Accepted to ICIP 2026