中文

上下文驱动索引裁剪:从数据质量视角提升 RALM 的精度

计算与语言 2025-02-07 v1 数据库

摘要

检索增强大语言模型(RALMs)在提高生成回答的准确性方面取得了显著进展。然而,现有研究往往忽视检索结果中的数据质量问题,这些问题通常由不准确的现有基于向量距离的检索方法引起。我们提出从数据质量视角通过上下文驱动索引裁剪(CDIT)框架来提升 RALM 回答的精度,其中上下文匹配依赖(CMDs)被用作逻辑数据质量规则来捕获和调节检索上下文之间的一致性。基于大语言模型(LLMs)的语义理解能力,CDIT 可以有效识别并丢弃与查询上下文不一致的检索结果,并进一步修改数据库中的索引,从而提高回答质量。实验在具有挑战性的问答任务上得到了验证。此外,CDIT 的灵活性通过其与各种语言模型和索引方法的兼容性得到了验证,这为同时增强 RALM 的数据质量和检索精度提供了一种有前景的方法。

关键词

引用

@article{arxiv.2408.05524,
  title  = {Context-Driven Index Trimming: A Data Quality Perspective to Enhancing Precision of RALMs},
  author = {Kexin Ma and Ruochun Jin and Xi Wang and Huan Chen and Jing Ren and Yuhua Tang},
  journal= {arXiv preprint arXiv:2408.05524},
  year   = {2025}
}