最近邻归一化提升多模态检索性能
计算机视觉与模式识别
2024-11-01 v1 人工智能
计算与语言
摘要
多模态模型利用大规模预训练在图像描述、视觉问答和跨模态检索等任务上取得了强劲但仍有不足的性能。本文提出了一种简单高效的方法——最近邻归一化(Nearest Neighbor Normalization, NNN),用于纠正已训练的对比式图文检索模型中的误差,且无需额外训练。我们在所有测试的对比模型(CLIP、BLIP、ALBEF、SigLIP、BEiT)和两个数据集(MS-COCO 与 Flickr30k)上均展示了检索指标的提升。NNN 需要参考数据库,但无需在该数据库上进行任何训练,并且甚至可以在微调后提高模型的检索准确率。
引用
@article{arxiv.2410.24114,
title = {Nearest Neighbor Normalization Improves Multimodal Retrieval},
author = {Neil Chowdhury and Franklin Wang and Sumedh Shenoy and Douwe Kiela and Sarah Schwettmann and Tristan Thrush},
journal= {arXiv preprint arXiv:2410.24114},
year = {2024}
}