ITA:面向多模态命名实体识别的图像-文本对齐方法
计算与语言
2022-09-21 v4
摘要
近年来,多模态命名实体识别(MNER)引起了广泛关注。大多数工作通过预训练目标检测器获得的区域级视觉表示来利用图像信息,并依赖注意力机制来建模图像与文本表示之间的交互。然而,由于图像和文本表示是在各自模态的数据上分别训练的且未对齐于同一空间,此类交互难以建模。由于文本表示在 MNER 中起着最重要的作用,本文中我们提出图像-文本对齐(ITA)将图像特征对齐到文本空间,从而更好地利用基于 transformer 的预训练文本嵌入中的注意力机制。ITA 首先将图像对齐为区域对象标签、图像级描述文本和光学字符作为视觉上下文,将其与输入文本拼接作为新的跨模态输入,然后送入预训练文本嵌入模型。这使得预训练文本嵌入模型的注意力模块更容易建模两种模态间的交互,因为它们均表示于文本空间中。ITA 进一步对齐从跨模态输入和文本输入视图预测的输出分布,使 MNER 模型在处理纯文本输入时更实用且对图像中的噪声更鲁棒。在我们的实验中,我们表明 ITA 模型即使在无图像信息情况下也能在多模态命名实体识别数据集上取得 SOTA 精度。
引用
@article{arxiv.2112.06482,
title = {ITA: Image-Text Alignments for Multi-Modal Named Entity Recognition},
author = {Xinyu Wang and Min Gui and Yong Jiang and Zixia Jia and Nguyen Bach and Tao Wang and Zhongqiang Huang and Fei Huang and Kewei Tu},
journal= {arXiv preprint arXiv:2112.06482},
year = {2022}
}
备注
Accepted to NAACL 2022