通过鼓励基于梯度解释的一致性改进视觉定位
计算机视觉与模式识别
2024-01-09 v4 计算与语言
机器学习
摘要
我们提出一种基于边界的损失,用于微调联合视觉-语言模型,使其基于梯度的解释与人工为相对较小的定位数据集提供的区域级标注一致。我们将该目标称为注意力掩码一致性(AMC),并证明它比先前依赖使用视觉-语言模型对目标检测器输出打分的方法产生更优的视觉定位结果。特别地,在标准视觉-语言建模目标之上用 AMC 训练的模型在 Flickr30k 视觉定位基准上取得了 86.49% 的 state-of-the-art 准确率,与在相同监督水平下训练的最佳先前模型相比绝对提升 5.38%。我们的方法在已建立的指代表达理解基准上也表现极好,在 RefCOCO+ 的简单测试中取得 80.34% 准确率,在困难划分中取得 64.55%。AMC 有效、易于实现且具有通用性,可被任何视觉-语言模型采用,并可使用任何类型的区域标注。
引用
@article{arxiv.2206.15462,
title = {Improving Visual Grounding by Encouraging Consistent Gradient-based Explanations},
author = {Ziyan Yang and Kushal Kafle and Franck Dernoncourt and Vicente Ordonez},
journal= {arXiv preprint arXiv:2206.15462},
year = {2024}
}
备注
CVPR 2023. Fix ReferIt results. Code: https://github.com/uvavision/AMC-grounding Project Webpage: https://vislang.ai/amc