探索可解释图像质量评估中指令数据质量的影响
计算机视觉与模式识别
2025-10-07 v1
摘要
近年来,随着强大多模态大语言模型(MLLM)的快速发展,可解释图像质量评估(IQA)逐渐受到关注,旨在为图像提供质量相关的描述和答案。为实现这一目标,最近的方法寻求构建大规模指令调谋数据集以赋予 MLLM 质量感知能力,遵循众所周知的 scaling 法则。然而,大量指令调谋数据会导致巨大的计算成本和冗余数据,从而损害模型性能。为此本文挑战了 scaling 法则,系统地研究了指令调谋数据集中数据质量在可解释 IQA 中发挥的作用。我们首先使用强大的预训练 MLLM,探讨在使用不同规模指令调谋数据进行微调后模型性能的变化。我们发现,使用合适比例随机选择数据子集甚至会比使用整个指令调谋数据集获得更好的结果,表明当前可解释 IQA 指令调谋数据存在冗余。除了随机抽取子集外,我们提出了一个基于聚类的数据选择框架,包含三个阶段:聚类特征提取、聚类配额分配和聚类抽样策略。然后我们系统地分析了每个阶段的选择,并提出了一个简单而高效的数据选择方法 IQA-Select,用于可解释 IQA。实验结果表明,IQA-Select 在 Q-Bench 和 AesBench 上分别使用仅 10% 所选数据即可实现 102.1% 和 103.7% 的全微调性能,显著降低了计算成本,同时实现了更好的性能。
引用
@article{arxiv.2510.03880,
title = {Exploring Instruction Data Quality for Explainable Image Quality Assessment},
author = {Yunhao Li and Sijing Wu and Huiyu Duan and Yucheng Zhu and Qi Jia and Guangtao Zhai},
journal= {arXiv preprint arXiv:2510.03880},
year = {2025}
}