中文

评估基于大语言模型的问答系统中的检索组件

计算与语言 2024-06-11 v1 信息检索

摘要

利用大语言模型(LLMs)的问答系统(QA)高度依赖检索组件为其提供领域特定信息,并降低生成不准确响应或幻觉的风险。尽管检索器的评估可以追溯到信息检索的早期研究,但在基于LLM的聊天机器人中评估其性能仍然是一个挑战。本研究提出了一个用于评估检索增强生成(RAG)聊天机器人中检索器的简单基线。我们的发现表明,该评估框架能更好地反映检索器的性能,并且与QA系统的整体性能更加一致。尽管传统的精确率、召回率和F1分数等指标可能无法完全捕捉LLM的能力——因为即使检索器不完美,LLM也能产生准确的响应——但我们的方法考虑了LLM忽略无关上下文的能力,以及其响应中潜在的错误和幻觉。

关键词

引用

@article{arxiv.2406.06458,
  title  = {Evaluating the Retrieval Component in LLM-Based Question Answering Systems},
  author = {Ashkan Alinejad and Krtin Kumar and Ali Vahdat},
  journal= {arXiv preprint arXiv:2406.06458},
  year   = {2024}
}