中文

文本中检测对象的融合用于视觉问答

计算与语言 2019-11-05 v2 计算机视觉与模式识别 机器学习

摘要

为推进多模态上下文模型,我们引入一种简洁而强大的神经网络架构,用于处理融合视觉与自然语言的数据。“文本中的边界框 Transformer”(B2T2)还在单一统一架构中利用了将词语与图像局部绑定的指称信息。B2T2 在 Visual Commonsense Reasoning 基准(https://visualcommonsense.com)上极为有效,相较已发表基线实现了误差率 25% 的相对降低,达到新的最优水平,并取得截至 2019 年 5 月 22 日公开排行榜上的最佳性能。详细的消融分析表明,将视觉特征早期融入文本分析是新架构生效的关键。我们提供了模型的参考实现(https://github.com/google-research/language/tree/master/language/question_answering/b2t2)。

关键词

引用

@article{arxiv.1908.05054,
  title  = {Fusion of Detected Objects in Text for Visual Question Answering},
  author = {Chris Alberti and Jeffrey Ling and Michael Collins and David Reitter},
  journal= {arXiv preprint arXiv:1908.05054},
  year   = {2019}
}