PARIC:基于预训练视觉语言模型的语言引导图像分类概率注意力正则化
计算机视觉与模式识别
2025-03-17 v1 人工智能
机器学习
摘要
语言引导注意力框架显著提升了图像分类的可解释性与性能;然而,依赖预训练视觉语言基础模型的确定性嵌入来生成参考注意力图,往往忽略了跨模态映射固有的多值性与不适定性特征。为解决这些局限性,我们引入了 PARIC,一个通过语言规范引导视觉注意力的概率框架。与确定性方法相比,我们的方法使预训练视觉语言模型能够生成概率参考注意力图,从而更有效地对齐文本与视觉模态,并融入不确定性估计。在基准测试问题上的实验表明,PARIC 提高了预测准确率,减轻了偏差,确保了预测的一致性,并提升了在多个数据集上的鲁棒性。
引用
@article{arxiv.2503.11360,
title = {PARIC: Probabilistic Attention Regularization for Language Guided Image Classification from Pre-trained Vison Language Models},
author = {Mayank Nautiyal and Stela Arranz Gheorghe and Kristiana Stefa and Li Ju and Ida-Maria Sintorn and Prashant Singh},
journal= {arXiv preprint arXiv:2503.11360},
year = {2025}
}