中文

展示、解读与讲述:维基百科中实体感知的上下文图像描述生成

计算机视觉与模式识别 2022-09-22 v1

摘要

人类利用先验知识描述图像,并能够将解释适配到特定上下文信息,甚至在上下文信息与图像不匹配时编造看似合理的解释。本文提出一项新任务:通过整合上下文知识对维基百科图像进行描述生成。具体而言,我们构建联合推理维基百科文章、维基媒体图像及其相关描述的模型,以产生上下文相关的描述。特别地,一张相似的维基媒体图像可用于阐释不同文章,所生成描述需适配特定上下文,从而让我们得以探究模型将描述调整至不同上下文信息的极限。该领域一项特别具有挑战性的任务是处理词典外词与命名实体。为此,我们提出一种预训练目标——掩码命名实体建模(MNEM),并表明该 pretext 任务相较基线模型带来提升。此外,我们验证了以维基百科 MNEM 目标预训练的模型能良好泛化至新闻描述数据集。我们还依据描述任务的难度定义了两种不同的测试划分。我们提供了各模态作用与重要性的见解,并指出了模型的局限性。代码、模型与数据划分已于录用后公开。

关键词

引用

@article{arxiv.2209.10474,
  title  = {Show, Interpret and Tell: Entity-aware Contextualised Image Captioning in Wikipedia},
  author = {Khanh Nguyen and Ali Furkan Biten and Andres Mafla and Lluis Gomez and Dimosthenis Karatzas},
  journal= {arXiv preprint arXiv:2209.10474},
  year   = {2022}
}