中文

基于Transformer的多模态候选生成与重排序用于维基百科图文匹配

计算机视觉与模式识别 2022-06-22 v1

摘要

随着网络和在线百科全书的普及,待管理数据量持续增长。例如在维基百科中,有数以百万计以多种语言编写的页面。这些页面包含的图像常缺乏文本上下文,在概念上处于游离状态,因此更难查找和管理。在本工作中,我们展示了为参加Kaggle上的维基百科图像- caption匹配挑战而设计的系统,该挑战的目标是使用与图像关联的数据(URL和视觉数据)从大量可用caption中找到正确caption。能够执行此任务的系统将改善大型在线百科全书中多媒体内容的可访问性与完整性。具体而言,我们提出一个由近期Transformer模型驱动的两个模型级联,能够高效且有效地推断查询图像数据与caption之间的相关性分数。我们通过大量实验验证,所提出的两模型方法是处理大量图像和caption的有效途径,同时将推理时的整体计算复杂度保持在有界范围内。我们的方法取得了显著结果,在Kaggle挑战的私有排行榜上获得了0.53的归一化折损累计增益(nDCG)值。

关键词

引用

@article{arxiv.2206.10436,
  title  = {Transformer-Based Multi-modal Proposal and Re-Rank for Wikipedia Image-Caption Matching},
  author = {Nicola Messina and Davide Alessandro Coccomini and Andrea Esuli and Fabrizio Falchi},
  journal= {arXiv preprint arXiv:2206.10436},
  year   = {2022}
}

备注

Accepted for publication at the Wiki-M3L workshop, co-located with ICLR 2022