图像中自然语言实体的上下文定位
计算机视觉与模式识别
2019-11-07 v1 计算与语言
机器学习
摘要
在本文中,我们引入一种上下文定位方法,该方法捕获对应文本实体与图像区域中的上下文以提高定位精度。具体而言,所提出的架构接受预训练的文本词元嵌入和来自现成目标检测器的图像对象特征作为输入。可添加额外的编码以捕获位置与空间信息从而增强特征质量。存在独立的文本与图像分支以促进针对不同模态各自的架构优化。文本分支在大规模掩码语言建模任务上预训练,而图像分支从头训练。接下来,模型分别通过高阶交互的若干层学习文本词元与图像对象的上下文表示。最终的定位头通过跨模态交互对文本与视觉表示之间的对应关系进行排序。在评估中,我们展示我们的模型在Flickr30K Entities数据集上达到了71.36%的SOTA定位精度。与通常需要在跨模态数据集上进行任务无关与任务特定预训练的相关工作相比,无需额外预训练即可提供有竞争力的结果。实现已公开于https://gitlab.com/necla-ml/grounding。
引用
@article{arxiv.1911.02133,
title = {Contextual Grounding of Natural Language Entities in Images},
author = {Farley Lai and Ning Xie and Derek Doran and Asim Kadav},
journal= {arXiv preprint arXiv:1911.02133},
year = {2019}
}
备注
Accepted to NeurIPS 2019 workshop on Visually Grounded Interaction and Language (ViGIL)