CustomIR: 针对已知文档语料的无监督稠密嵌入微调
信息检索
2025-10-29 v2 人工智能
摘要
稠密嵌入模型对现代信息检索至关重要,尤其是在 RAG 流程中,但其性能往往在应用到预训练分布之外的专业语料时会下降。为此,我们引入 CustomIR,一个针对无监督适配预训练语言嵌入模型到特定语料库的框架,使用合成生成的查询-文档对。CustomIR 利用大型语言模型(LLM)创建以已知目标语料为基础的多样查询,配以 LLM 验证的硬负样本,无需高成本的人工标注。实验在企业电子邮件和消息数据集上显示,CustomIR 能始终提升检索有效性,小型模型在 Recall@10 上可提升最高 2.3 分。这一性能提升使这些小型模型能够与 much larger alternatives 媲美,从而实现更经济的 RAG 部署。这些结果凸显了有针对性的合成微调提供了一种可扩展且成本效益高的提升特定领域性能的策略。
引用
@article{arxiv.2510.21729,
title = {CustomIR: Unsupervised Fine-Tuning of Dense Embeddings for Known Document Corpora},
author = {Nathan Paull},
journal= {arXiv preprint arXiv:2510.21729},
year = {2025}
}