面向基于定位的多模态预训练的富含命名实体描述的超类化
计算机视觉与模式识别
2023-04-27 v1
摘要
命名实体在自然伴随图像出现的文本中无处不在,尤其在新闻或维基百科文章等领域。在先前工作中,命名实体已被确定为在维基百科上预训练并在无命名实体基准数据集上评估的图像-文本检索模型性能低下的可能原因。由于很少被提及,命名实体可能难以建模。它们也代表了自监督模型错失的学习机会:模型可能错过命名实体与图像中对象之间的关联,但如果使用该对象的更常见术语来提及,则不会错过。在这项工作中,我们研究超类化(hypernymization)作为处理命名实体的一种方式,用于预训练基于定位的多模态模型以及用于开放词汇检测上的微调。我们提出两种执行超类化的方法:(1)依赖综合概念本体的“手动”流水线,以及(2)训练语言模型以学习执行超类化的“习得”方法。我们在来自维基百科和《纽约时报》的数据上运行实验。我们报告了超类化后对相关对象预训练性能的提升,并展示了超类化在开放词汇检测上的前景,特别是在训练期间未见过的类别上。
引用
@article{arxiv.2304.13130,
title = {Hypernymization of named entity-rich captions for grounding-based multi-modal pretraining},
author = {Giacomo Nebbia and Adriana Kovashka},
journal= {arXiv preprint arXiv:2304.13130},
year = {2023}
}