了解纯文本推理在盲目图像质量评估中的作用
计算机视觉与模式识别
2026-03-26 v2 人工智能
摘要
文本推理最近在盲目图像质量评估(BIQA)中得到广泛应用,但文本如何贡献于质量预测以及文本在多大程度上能代表与得分相关的图像内容仍不清楚。本工作从信息流动角度回答这些问题,通过比较现有BIQA模型与三种旨在学习图像-文本-得分关系的范式:链式思维(Chain-of-Thought)、自洽(Self-Consistency)和自动编码器(Autoencoder)。我们的实验表明,仅使用文本信息进行预测时,现有模型的得分预测性能显著下降。而链式思维范式对BIQA性能的提升贡献有限,自洽范式显著缩小了图像条件和文本条件预测之间的差距,将PLCC/SRCC差值缩小至0.02/0.03。自动编码器范式在缩小图像-文本差距方面不如自洽范式有效,但它揭示了进一步优化的方向。这些发现为改进BIQA和高层视觉任务中的文本推理提供了见解。
引用
@article{arxiv.2601.02441,
title = {Understanding Pure Textual Reasoning for Blind Image Quality Assessment},
author = {Yuan Li and Shin'ya Nishida},
journal= {arXiv preprint arXiv:2601.02441},
year = {2026}
}
备注
Code available at https://github.com/AnonymousUserPublish/Bridging-Image-Text-Gap-for-BIQA/tree/main. This work is accepted by ICME (IEEE International Conference on Multimedia and Expo) 2026