中文

最近邻归一化提升多模态检索性能

计算机视觉与模式识别 2024-11-01 v1 人工智能 计算与语言

摘要

多模态模型利用大规模预训练在图像描述、视觉问答和跨模态检索等任务上取得了强劲但仍有不足的性能。本文提出了一种简单高效的方法——最近邻归一化(Nearest Neighbor Normalization, NNN),用于纠正已训练的对比式图文检索模型中的误差,且无需额外训练。我们在所有测试的对比模型(CLIP、BLIP、ALBEF、SigLIP、BEiT)和两个数据集(MS-COCO 与 Flickr30k)上均展示了检索指标的提升。NNN 需要参考数据库,但无需在该数据库上进行任何训练,并且甚至可以在微调后提高模型的检索准确率。

关键词

引用

@article{arxiv.2410.24114,
  title  = {Nearest Neighbor Normalization Improves Multimodal Retrieval},
  author = {Neil Chowdhury and Franklin Wang and Sumedh Shenoy and Douwe Kiela and Sarah Schwettmann and Tristan Thrush},
  journal= {arXiv preprint arXiv:2410.24114},
  year   = {2024}
}