通过双向跨模态匹配的无配对指代表达定位
计算机视觉与模式识别
2022-06-07 v2
摘要
指代表达定位是计算机视觉中重要且具挑战性的任务。为避免传统指代表达定位中的费力标注,无配对指代表达定位被提出,其训练数据仅含若干图像与查询而无对应关系。现有少数无配对指代表达定位方案仍属初步,源于学习图像-文本匹配的挑战以及无配对数据缺乏自顶向下引导。本文提出一种新颖的双向跨模态匹配(BiCM)框架以应对这些挑战。具体地,我们设计了查询感知注意力图(QAM)模块,通过生成查询特定的视觉注意力图引入自顶向下视角。进一步引入跨模态目标匹配(COM)模块,其利用新近涌现的图像-文本匹配预训练模型 CLIP,从自底向上视角预测目标对象。自顶向下与自底向上预测随后通过相似度融合(SF)模块整合。我们还提出知识适配匹配(KAM)模块,利用无配对训练数据将预训练知识适配至目标数据集与任务。实验表明,我们的框架在两个流行定位数据集上分别以 6.55% 与 9.94% 优于先前工作。
引用
@article{arxiv.2201.06686,
title = {Unpaired Referring Expression Grounding via Bidirectional Cross-Modal Matching},
author = {Hengcan Shi and Munawar Hayat and Jianfei Cai},
journal= {arXiv preprint arXiv:2201.06686},
year = {2022}
}
备注
9 pages, 7 figures