中文

基于语义先验精炼的弱监督视觉-文本定位

计算机视觉与模式识别 2023-09-27 v2 人工智能 计算与语言 机器学习 多媒体

摘要

弱监督视觉-文本定位仅使用图像-句子对,旨在学习各自实体提及的区域-短语对应关系。与有监督方法相比,由于边界框与文本短语的对应关系不可用,学习更为困难。有鉴于此,我们提出语义先验精炼模型(SPRM),其预测由两大主要模块的输出结合得到。第一个未经训练的模块旨在返回文本短语与边界框之间的粗略对齐。第二个经训练的模块由两个子组件构成,用于精炼粗略对齐以提升最终短语-边界框对齐的准确度。该模型训练时最大化图像与句子间的多模态相似度,同时最小化同一句子与一张新无关图像(精心选取以在训练中提供最大帮助)的多模态相似度。我们的方法在两个流行数据集 Flickr30k Entities 和 ReferIt 上取得了最先进结果,尤其在 ReferIt 上以 9.6% 的绝对提升脱颖而出。此外,得益于未训练组件,仅使用极小部分训练样本即可达到有竞争力的性能。

关键词

引用

@article{arxiv.2305.10913,
  title  = {Weakly-Supervised Visual-Textual Grounding with Semantic Prior Refinement},
  author = {Davide Rigoni and Luca Parolari and Luciano Serafini and Alessandro Sperduti and Lamberto Ballan},
  journal= {arXiv preprint arXiv:2305.10913},
  year   = {2023}
}