基于语义先验精炼的弱监督视觉-文本定位
计算机视觉与模式识别
2023-09-27 v2 人工智能
计算与语言
机器学习
多媒体
摘要
弱监督视觉-文本定位仅使用图像-句子对,旨在学习各自实体提及的区域-短语对应关系。与有监督方法相比,由于边界框与文本短语的对应关系不可用,学习更为困难。有鉴于此,我们提出语义先验精炼模型(SPRM),其预测由两大主要模块的输出结合得到。第一个未经训练的模块旨在返回文本短语与边界框之间的粗略对齐。第二个经训练的模块由两个子组件构成,用于精炼粗略对齐以提升最终短语-边界框对齐的准确度。该模型训练时最大化图像与句子间的多模态相似度,同时最小化同一句子与一张新无关图像(精心选取以在训练中提供最大帮助)的多模态相似度。我们的方法在两个流行数据集 Flickr30k Entities 和 ReferIt 上取得了最先进结果,尤其在 ReferIt 上以 9.6% 的绝对提升脱颖而出。此外,得益于未训练组件,仅使用极小部分训练样本即可达到有竞争力的性能。
引用
@article{arxiv.2305.10913,
title = {Weakly-Supervised Visual-Textual Grounding with Semantic Prior Refinement},
author = {Davide Rigoni and Luca Parolari and Luciano Serafini and Alessandro Sperduti and Lamberto Ballan},
journal= {arXiv preprint arXiv:2305.10913},
year = {2023}
}