中文

ALADIN:蒸馏细粒度对齐分数以实现高效图文匹配与检索

计算机视觉与模式识别 2022-08-01 v1 人工智能 计算与语言 多媒体

摘要

图文匹配在涉及视觉与语言联合理解的任务中正占据主导地位。文献中,该任务常被用作预训练目标以构建能联合处理图像与文本的架构。此外,它有一个直接的下游应用:跨模态检索,即查找与给定查询文本相关的图像或反之。解决该任务在跨模态搜索引擎中至关重要。许多近期方法提出了图文匹配问题的有效方案,大多使用近期的视觉-语言(VL)Transformer 网络。然而,这些模型通常计算开销大,尤其在推理时。这阻碍了它们在大规模跨模态检索场景中的采用,此类场景需近乎即时向用户提供结果。本文中,我们提出以 ALign And DIstill Network(ALADIN)填补有效性与效率间的鸿沟。ALADIN 首先在细粒度层面对齐图像与文本以产生高效分数,然后通过蒸馏细粒度对齐所得的相关性分数,学习一个可执行高效 kNN 搜索的共享嵌入空间。我们在 MS-COCO 上取得了显著结果,表明我们的方法可与最先进的 VL Transformer 竞争,同时快近 90 倍。复现结果的代码见 https://github.com/mesnico/ALADIN。

关键词

引用

@article{arxiv.2207.14757,
  title  = {ALADIN: Distilling Fine-grained Alignment Scores for Efficient Image-Text Matching and Retrieval},
  author = {Nicola Messina and Matteo Stefanini and Marcella Cornia and Lorenzo Baraldi and Fabrizio Falchi and Giuseppe Amato and Rita Cucchiara},
  journal= {arXiv preprint arXiv:2207.14757},
  year   = {2022}
}

备注

CBMI 2022