文本中检测对象的融合用于视觉问答
计算与语言
2019-11-05 v2 计算机视觉与模式识别
机器学习
摘要
为推进多模态上下文模型,我们引入一种简洁而强大的神经网络架构,用于处理融合视觉与自然语言的数据。“文本中的边界框 Transformer”(B2T2)还在单一统一架构中利用了将词语与图像局部绑定的指称信息。B2T2 在 Visual Commonsense Reasoning 基准(https://visualcommonsense.com)上极为有效,相较已发表基线实现了误差率 25% 的相对降低,达到新的最优水平,并取得截至 2019 年 5 月 22 日公开排行榜上的最佳性能。详细的消融分析表明,将视觉特征早期融入文本分析是新架构生效的关键。我们提供了模型的参考实现(https://github.com/google-research/language/tree/master/language/question_answering/b2t2)。
引用
@article{arxiv.1908.05054,
title = {Fusion of Detected Objects in Text for Visual Question Answering},
author = {Chris Alberti and Jeffrey Ling and Michael Collins and David Reitter},
journal= {arXiv preprint arXiv:1908.05054},
year = {2019}
}