中文

基于 Elasticsearch 优化检索增强生成以提升问答系统性能

信息检索 2024-10-21 v1

摘要

本研究旨在提高大规模语言模型(LLM)在回答问题方面的准确性和质量,通过将 Elasticsearch 集成到检索增强生成(RAG)框架中。实验使用 Stanford Question Answering Dataset(SQuAD)2.0 版本作为测试数据集,比较了不同检索方法的性能,包括基于关键词匹配或语义相似度计算的传统方法、BM25-RAG 与 TF-IDF-RAG,以及新提出的 ES-RAG方案。结果表明,ES-RAG 不仅在检索效率上显著优于其他方法,还在准确率等关键指标上表现更佳,准确率比 TF-IDF-RAG 高出 0.51 个百分点。此外,Elasticsearch 的强大搜索功能和丰富的配置选项使整个问答系统能够更好地处理复杂查询,根据用户多样化的需求提供更灵活和高效的响应。未来的研究方向可以进一步探索如何优化 Elasticsearch 与 LLM 之间的交互机制,例如引入更高层次的语义理解和情境感知能力,以实现更智能和人性化的问答体验。

关键词

引用

@article{arxiv.2410.14167,
  title  = {Optimizing Retrieval-Augmented Generation with Elasticsearch for Enhanced Question-Answering Systems},
  author = {Jiajing Chen and Runyuan Bao and Hongye Zheng and Zhen Qi and Jianjun Wei and Jiacheng Hu},
  journal= {arXiv preprint arXiv:2410.14167},
  year   = {2024}
}