中文

DPC-VQA:用于视频质量评估的解耦感知与残差校准框架

计算机视觉与模式识别 2026-04-15 v1 多媒体

摘要

最近的多模态大语言模型(MLLMs)在视频质量评估(VQA)任务上表现突出,但将其适用于新场景代价高昂,需大规模重新训练和昂贵的用户意见分数(MOS)标注。本文认为,预训练的 MLLM 已为 VQA 提供了有用的感知先验,而主要挑战在于高效地将其校准到目标 MOS 空间。基于此洞见,我们提出了 DPC-VQA,这是一个用于视频质量评估的感知与校准解耦框架。具体而言,DPC-VQA 使用冻结的 MLLM 提供基础质量估计和感知先验,并采用轻量级校准分支预测目标场景的残差校正。该设计在避免高成本的端到端重新训练的同时,保持可靠性能,训练和数据成本更低。在用户生成内容(UGC)和 AI 生成内容(AIGC)基准上的大量实验表明,DPC-VQA 在代表性基线之间取得竞争成绩,仅使用常规 MLLM-based VQA 方法可训练参数的不到 2%,仅需 20% 的 MOS 标签仍能有效工作。

关键词

引用

@article{arxiv.2604.12813,
  title  = {DPC-VQA: Decoupling Quality Perception and Residual Calibration for Video Quality Assessment},
  author = {Xinyue Li and Shubo Xu and Zhichao Zhang and Zhaolin Cai and Yitong Chen and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2604.12813},
  year   = {2026}
}