中文

使用实体关系图和模型感知对比采样提高文档检索嵌入准确性

信息检索 2024-10-25 v1 人工智能 计算与语言

摘要

本文提出了 APEX-Embedding-7B(Advanced Processing for Epistemic eXtraction,高级情报提取),一个具有 70 亿参数的解码器-only 文本特征提取模型,专为文档检索增强生成(RAG)任务而设计。我们的方法采用两种训练技术,实现了对事实性关注的显著性提升:(1)使用结构化实体关系图进行预收敛中断式微调,旨在转移模型注意力并对事实性内容建立偏好,而非语义风格——尽管未直接为此训练,却显著提升了纯文本性能;(2)模型感知对比采样,基于基础模型的能力创建硬负样本和软负样本的平衡且分布均匀的检索图。这种结合的方法显著性提升了纯文本查询/文档对的检索性能,在我们的评估中,使其在纯文本查询/文档对检索中实现绝对的 rank@1 准确率 90.86%(相较于下一位领先模型提升了 6.26%),同时将训练数据输入上下文大小在查询和文档文本方面平均缩小了 37.71%。基于我们的评估,该模型在更长上下文文档检索任务中建立了新的最先进标准。

关键词

引用

@article{arxiv.2410.18105,
  title  = {Improving Embedding Accuracy for Document Retrieval Using Entity Relationship Maps and Model-Aware Contrastive Sampling},
  author = {Thea Aviss},
  journal= {arXiv preprint arXiv:2410.18105},
  year   = {2024}
}

备注

10 Pages, 9 Figures