中文

一种用于视觉-文本定位的更优损失函数

计算机视觉与模式识别 2022-02-03 v2 机器学习

摘要

给定一个文本短语和一幅图像,视觉定位任务的目的是定位图像中被该句子所指代的内容。这是一项具有挑战性的任务,在人机交互、图像-文本指代消解和视频-文本指代消解中有若干现实应用。近年来,已有若干工作通过提出越来越庞大和复杂的模型来解决该问题,这些模型试图比以往更好地捕捉视觉-文本依赖关系。这些模型通常由两个主要组件构成,分别关注如何学习有用的多模态特征以用于定位,以及如何改进视觉指称的预测边界框。在这两个子任务之间找到恰当的学习平衡并不容易,且当前模型在这一问题上未必最优。在本工作中,我们提出一种基于边界框类别概率的损失函数,其:(i) 改进边界框的选择;(ii) 改进边界框坐标的预测。我们的模型尽管使用了简单的多模态特征融合组件,却能在两个广泛采用的数据集上取得比 SOTA 模型更高的准确率,并在上述两个子任务间实现了更好的学习平衡。

关键词

引用

@article{arxiv.2108.05308,
  title  = {A Better Loss for Visual-Textual Grounding},
  author = {Davide Rigoni and Luciano Serafini and Alessandro Sperduti},
  journal= {arXiv preprint arXiv:2108.05308},
  year   = {2022}
}