面向命名实体识别的扁平多模态交互Transformer
计算机视觉与模式识别
2023-03-10 v2 计算与语言
摘要
多模态命名实体识别(MNER)旨在借助图像,在社交媒体帖子中识别实体跨度并确定其类别。然而,在主流的MNER方法中,不同模态的交互通常通过自注意力与交叉注意力的交替或过度依赖门控机制来实现,这导致文本与图像的细粒度语义单元之间对应不精确且存在偏差。为解决该问题,我们提出一种用于MNER的扁平多模态交互Transformer(FMIT)。具体而言,我们首先利用句子中的名词短语和通用领域词来获取视觉线索。然后,我们将视觉与文本的细粒度语义表示转换为统一的格结构,并设计一种新颖的相对位置编码以在Transformer中匹配不同模态。同时,我们提出利用实体边界检测作为辅助任务来缓解视觉偏差。实验表明,我们的方法在两个基准数据集上取得了新的最先进(SOTA)性能。
引用
@article{arxiv.2208.11039,
title = {Flat Multi-modal Interaction Transformer for Named Entity Recognition},
author = {Junyu Lu and Dixiang Zhang and Pingjian Zhang},
journal= {arXiv preprint arXiv:2208.11039},
year = {2023}
}
备注
Accepted by COLING 2022, oral paper