RpBERT:一种基于文本-图像关系传播的多模态NER BERT模型
计算与语言
2021-02-08 v1 机器学习
摘要
近年来,多模态命名实体识别(MNER)利用图像来提高推文中NER的准确率。然而,大多数多模态方法使用注意力机制提取视觉线索,而不考虑文本与图像是否相关。实际上,在推文中不相关的文本-图像对占很大比例。与文本无关的视觉线索会对多模态模型学习产生不确定甚至负面的影响。本文中,我们将文本-图像关系传播方法引入多模态BERT模型。我们集成软门或硬门来选择视觉线索,并提出一种多任务算法在MNER数据集上训练。在实验中,我们深入分析了使用文本-图像关系传播前后视觉注意力的变化。我们的模型在MNER数据集上取得了最先进的性能。
引用
@article{arxiv.2102.02967,
title = {RpBERT: A Text-image Relation Propagation-based BERT Model for Multimodal NER},
author = {Lin Sun and Jiquan Wang and Kai Zhang and Yindu Su and Fangsheng Weng},
journal= {arXiv preprint arXiv:2102.02967},
year = {2021}
}
备注
Accepted by AAAI2021