中文

在受控反事实扰动下的视觉定位异质性研究

计算机视觉与模式识别 2026-05-12 v1 人工智能

摘要

视觉定位基准假设描述语义对象始终存在于图像中,对模型而言很少在语义不匹配的标题下进行评估。在此类情况下,模型常表现出近似行为,生成满足表达式部分要求的合理边界框(例如保留原始对象而忽略修改后的上下文线索)。由于不匹配的标题代表现实中的边缘情况,这种行为会损害可靠性,并引发可解释性方面的担忧。因此,识别其潜在原因对于改进模型的忠诚性和可解释性至关重要。在采用机制性可解释性观点后,本工作检讎是否存在嵌入异质性导致反事实失败。引入一种受控反事实标题生成协议,以系统性地扰动对象或上下文组件置于预定义的嵌入相似区间内,实现对定位行为进行细粒度分析。在两个嵌入几何结构显著不同的基于 Transformer 的模型(基于 BERT 的 TransVG 和基于 CLIP 的 SwimVG)上进行实验,结果显示余弦相似度与近似之间不存在有意义的相关性。这表明异质性本身并不能解释反事实错误,改进鲁棒性需要检讎嵌入空间中更细粒度的几何属性。

关键词

引用

@article{arxiv.2605.09090,
  title  = {Investigating Anisotropy in Visual Grounding under Controlled Counterfactual Perturbations},
  author = {Gabriele Lombardo and Luigi Maiorana and Liliana Lo Presti and Marco La Cascia},
  journal= {arXiv preprint arXiv:2605.09090},
  year   = {2026}
}

备注

To be published in the proceedings of the 5th Explainable AI for Computer Vision (XAI4CV) Workshop at CVPR 2026