中文

以视觉上下文辅助文本内表示的多模态命名实体识别

计算机视觉与模式识别 2019-04-03 v1 计算与语言

摘要

随着Twitter和Instagram等社交媒体的大量涌现,人们每天分享数十亿条包含图像和文本的多媒体帖子。通常,这些帖子中的文本简短、非正式且含噪声,导致歧义,而利用图像可消解这些歧义。本文中,我们探索此类多媒体帖子以文本为中心的命名实体识别任务。我们提出一个端到端模型,学习文本与图像的联合表示。我们的模型扩展了多维自注意力技术,其中图像有助于增强词间关系。实验表明,我们的模型能够更准确地捕捉文本与视觉上下文,在Twitter多模态命名实体识别数据集上取得最先进结果。

关键词

引用

@article{arxiv.1904.01356,
  title  = {Aiding Intra-Text Representations with Visual Context for Multimodal Named Entity Recognition},
  author = {Omer Arshad and Ignazio Gallo and Shah Nawaz and Alessandro Calefati},
  journal= {arXiv preprint arXiv:1904.01356},
  year   = {2019}
}