中文

基于文档的QA中LLMs评估:使用Cogtale数据集的精确答案选择与数值抽取

信息检索 2024-01-04 v4

摘要

基于文档的问答(QA)任务对精确信息检索至关重要。尽管部分现有工作聚焦于评估大语言模型(LLM)从文档中检索与回答问题的性能,但要求从预定义选项中精确选答与数值抽取的QA类型下LLM性能的评估尚待充分开展。在本文中,我们专门关注这一未被充分探索的情形,并对LLM(GPT-4与GPT-3.5)在零样本设定下、涵盖单选择、是否、多选择与数字抽取等来自文档的问题类型进行实证分析。我们使用CogTale数据集评估,其提供人类专家标注的响应,为精度与事实依据提供了鲁棒基准。我们发现LLM(尤其是GPT-4)在给定相关上下文时能精确回答许多单选择与是否问题,展现了其在信息检索任务中的效力。然而,面对多与数字抽取格式时其性能下降,拉低了模型在该任务上的整体表现,表明这些模型对此任务尚不够可靠。这限制了LLM在需从文档精确抽取信息的应用(如元分析任务)中的使用。这些发现依赖于检索器提供准确响应所需相关上下文的假设,强调了进一步研究的必要。我们的工作为持续的数据集评估提供了框架,确保LLM在信息检索与文档分析中的应用持续满足演进的标准。

关键词

引用

@article{arxiv.2311.07878,
  title  = {Evaluating LLMs on Document-Based QA: Exact Answer Selection and Numerical Extraction using Cogtale dataset},
  author = {Zafaryab Rasool and Stefanus Kurniawan and Sherwin Balugo and Scott Barnett and Rajesh Vasa and Courtney Chesser and Benjamin M. Hampstead and Sylvie Belleville and Kon Mouzakis and Alex Bahar-Fuchs},
  journal= {arXiv preprint arXiv:2311.07878},
  year   = {2024}
}

备注

10 pages, 1 figure