中文

面向图像质量评分与解释的大规模多模态模型教学

计算机视觉与模式识别 2025-03-13 v1

摘要

图像质量评分与解释是图像质量评估(IQA)的两个基本组成部分。前者对图像质量进行量化,后者则实现关于图像质量的描述性问答。传统上,这两个任务被独立处理。然而,从人类视觉系统(HVS)和感知-决策整合模型的视角来看,它们本质上是相互关联的:解释是评分的基础,而评分则提供了对解释的抽象总结。因此,在单一模型内统一这些能力既直观又符合逻辑。在本文中,我们提出了 Q-SiT(Quality Scoring and Interpreting joint Teaching,质量评分与解释联合教学),这是一个使大型多模态模型(LMMs)能够同时学习图像质量评分与解释的统一框架。我们通过将传统 IQA 数据集转化为可学习的问答数据集,并引入人工标注的质量解释数据进行训练来实现这一点。此外,我们引入了一种高效的评分与解释平衡策略,该策略首先在轻量级 LMMs 上确定最优数据混合比例,然后将该比例映射到主 LMMs 上进行微调调整。该策略不仅缓解了任务干扰并增强了跨任务知识迁移,而且与在全规模 LMMs 上直接优化相比,显著降低了计算成本。借助这一联合学习框架及相应的训练策略,我们开发了 Q-SiT,这是首个能够同时执行图像质量评分与解释任务的模型,并推出了其轻量级变体 Q-SiT-mini。实验结果表明,Q-SiT 在两项任务中均取得了强劲的性能,并具有卓越的 IQA 泛化能力。项目页面位于 https://github.com/Q-Future/Q-SiT。

关键词

引用

@article{arxiv.2503.09197,
  title  = {Teaching LMMs for Image Quality Scoring and Interpreting},
  author = {Zicheng Zhang and Haoning Wu and Ziheng Jia and Weisi Lin and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2503.09197},
  year   = {2025}
}