中文

面向多指令文档的对话式问答大语言模型基准测试

计算与语言 2024-10-02 v1

摘要

指令文档是完成各种任务的丰富知识来源,但其在对话式问答(CQA)中的独特挑战尚未得到充分探索。现有基准主要关注来自单一叙事文档的基础事实问答,难以评估模型理解复杂现实指令文档并在日常生活中提供准确分步指导的能力。为填补这一差距,我们提出了 InsCoQA,一个针对评估大语言模型(LLMs)在指令文档上下文中的 CQA 能力的新基准。该基准源自广泛的百科式指令内容,评估模型在检索、解释和准确总结来自多个文档的程序性指导方面的能力,反映了现实指令任务的复杂性和多面性。此外,为了全面评估在 InsCoQA 上表现突出的大语言模型,我们提出了 InsEval,一个由 LLM 辅助的评估器,用于衡量生成响应和程序指令的完整性和准确性。

关键词

引用

@article{arxiv.2410.00526,
  title  = {Benchmarking Large Language Models for Conversational Question Answering in Multi-instructional Documents},
  author = {Shiwei Wu and Chen Zhang and Yan Gao and Qimeng Wang and Tong Xu and Yao Hu and Enhong Chen},
  journal= {arXiv preprint arXiv:2410.00526},
  year   = {2024}
}