文本嵌入模型信息检索的高效微调方法:对比学习惩罚 (CLP)
信息检索
2024-12-24 v1 人工智能
摘要
文本嵌入模型在自然语言处理中发挥着关键作用,尤其在信息检索中,其重要性更是因 RAG (检索增强生成) 的近期应用而凸显。本研究提出了一套高效的微调方法,涵盖数据选择、损失函数和模型架构,以提高预训练文本嵌入模型在信息检索任务中的性能。特别是,本研究提出了一种新的对比学习惩罚函数,以克服现有对比学习的局限性。该提议方法在文档检索任务中显著优于现有方法。本研究的代码可在 https://github.com/CreaLabs/Enhanced-BGE-M3-with-CLP-and-MoE 上获取,最佳性能模型可在 https://huggingface.co/CreaLabs 上找到。
引用
@article{arxiv.2412.17364,
title = {Efficient fine-tuning methodology of text embedding models for information retrieval: contrastive learning penalty (clp)},
author = {Jeongsu Yu},
journal= {arXiv preprint arXiv:2412.17364},
year = {2024}
}