NV-Retriever:通过有效硬负采样改进文本嵌入模型
信息检索
2025-02-10 v2 人工智能
摘要
文本嵌入模型在语义搜索和基于检索增强生成(RAG)的问答系统等信息检索应用中备受欢迎。这些模型通常是微调对抗学习目标的 Transformer 模型。微调嵌入模型的一个挑战是选择高质量的硬负文本段落进行对抗学习。本文介绍了一系列正相关得分感知的采矿方法,该方法以正相关得分为锚点,用于有效删除错误负样本,从而实现更快的训练和更准确的检索模型。我们对硬负采样方法的配置进行了消融研究,探讨了不同的教师模型和基础模型。我们进一步在大规模数据上展示了我们所提出采矿方法的有效性,NV-Retriever-v1 模型在 MTEB 检索(BEIR)基准上得分 60.9,位于 2024 年 7 月发布时 MTEB 检索榜单第 1 名。
关键词
引用
@article{arxiv.2407.15831,
title = {NV-Retriever: Improving text embedding models with effective hard-negative mining},
author = {Gabriel de Souza P. Moreira and Radek Osmulski and Mengyao Xu and Ronay Ak and Benedikt Schifferer and Even Oldridge},
journal= {arXiv preprint arXiv:2407.15831},
year = {2025}
}