中文

Q-Adapt:适用于视觉质量评估的 LMM 适应方法基于渐进式指令调优

计算机视觉与模式识别 2025-04-03 v1 多媒体

摘要

大型多模态基础模型(LMM)的快速发展为可能的可解释图像质量评估(EIQA)提供了来自两个视角的指令调优路径:整体质量解释和属性级感知回答。然而,现有工作通常忽略了这两种感知解释在联合指令调优期间的冲突,导致感知理解不足。为缓解此问题,我们提出了一种新的感知导向指令调优范式,即 Q-Adapt,旨在消除这两种 EIQA 任务之间的冲突,并在适配 LMM 时实现两者的协同,从而提升图像质量评估的多维解释能力。具体而言,我们提出了渐进式指令调优策略,将 LMM 适用于 EIQA 的适配过程分为两个阶段:第一个阶段通过高效的迁移学习策略(即 LoRA)赋予 LMM 针对两项任务的通用感知知识;第二个阶段引入指令自适应视觉提示调优,以动态适应两种任务来源的不同指令。如此一来,我们提出的 Q-Adapt 能够构建一个轻量级的视觉质量评估器,在各种感知相关基准和常用 IQA 数据集上表现出与之相当,甚至在某些情况下更佳。源代码已公开于 https://github.com/yeppp27/Q-Adapt。

关键词

引用

@article{arxiv.2504.01655,
  title  = {Q-Adapt: Adapting LMM for Visual Quality Assessment with Progressive Instruction Tuning},
  author = {Yiting Lu and Xin Li and Haoning Wu and Bingchen Li and Weisi Lin and Zhibo Chen},
  journal= {arXiv preprint arXiv:2504.01655},
  year   = {2025}
}