中文

通过全局-局部自适应互动释放视觉 Transformer 在图像质量评估中的潜能

计算机视觉与模式识别 2026-05-19 v1

摘要

在盲测图像质量评估(BIQA)领域,准确预测真实失真图像的感知质量仍具有高度挑战性, due to 来自自然环境中多样化和复杂失真。虽然已有方法取得了显著准确性,但其可扩展性常受主观标注成本高和可用数据集规模有限的制约。近期大规模预训练视觉模型的进展引入了强大的语义和表示能力,但其应用于 IQA 任务受到巨大的计算需求和次优微调效率的限制。为克服这些限制,我们引入了全局-局部互动适配器(GLIA),一个新型框架,通过双流特征提取机制结合交互式全局-局部融合,有效地利用预训练视觉 Transformer。通过同时保留全局语义信息和细粒度局部细节,我们的方法在保持显著更少可训练参数的同时,提供了卓越的预测准确性和鲁棒性。多个基准上的广泛实验验证了我们方法的有效性与优越性。

关键词

引用

@article{arxiv.2605.17748,
  title  = {Unleashing Vision Transformer Potential In Image Quality Assessment via Global-Local Adaptive Interaction},
  author = {Yu Li and Puchao Zhou and Yachun Mi and Yanfeng Wu and Xiaoming Wang and Shaohui Liu},
  journal= {arXiv preprint arXiv:2605.17748},
  year   = {2026}
}