分割与理解:面向细粒度图像质量评估的区域感知语义注意力与大语言模型
计算机视觉与模式识别
2025-08-12 v1
摘要
无参考图像质量评估(NR-IQA)旨在模拟与主观人类感知对齐的图像质量感知过程。然而,现有的NR-IQA方法要么关注全局表示,导致对语义显著区域的洞察有限,要么对区域特征采用均匀加权,削弱了对局部质量变化的敏感性。本文提出了一种细粒度图像质量评估模型RSFIQA,该模型整合了区域级失真信息以感知多维质量差异。为增强区域质量感知,我们首先利用Segment Anything Model (SAM)将输入图像动态划分为不重叠的语义区域。对于每个区域,我们训练一个强大的多模态大语言模型(MLLM)来提取描述性内容并感知多维失真,从而实现对局部语义和质量退化的全面理解。为有效利用这些信息,我们引入了区域感知语义注意力(RSA)机制,该机制通过聚合局部区域的细粒度表示生成全局注意力图。此外,RSFIQA是骨干网络无关的,可以无缝集成到各种深度神经网络架构中。大量实验证明了所提方法的鲁棒性和有效性,在多个基准数据集上取得了具有竞争力的质量预测性能。
引用
@article{arxiv.2508.07818,
title = {Segmenting and Understanding: Region-aware Semantic Attention for Fine-grained Image Quality Assessment with Large Language Models},
author = {Chenyue Song and Chen Hui and Haiqi Zhu and Feng Jiang and Yachun Mi and Wei Zhang and Shaohui Liu},
journal= {arXiv preprint arXiv:2508.07818},
year = {2025}
}