中文

KIWI:用于回答研究问题的知识密集型写作指令数据集

计算与语言 2024-03-07 v1

摘要

适配为遵循用户指令的大型语言模型(LLM)现已广泛部署为对话代理。在本文中,我们研究了一种日益常见的指令遵循任务:提供写作辅助以撰写长篇回答。为了评估当前 LLM 在该任务上的能力,我们构建了 KIWI,这是一个科学领域中的知识密集型写作指令数据集。给定一个研究问题、一个初始模型生成的回答以及一组相关论文,专家标注者会迭代地发布指令,要求模型修订并改进其回答。我们收集了与三个最先进 LLM 进行的 234 个交互会话中的 1,260 个交互轮次。每一轮都包含用户指令、模型响应以及对模型响应的人工评估。通过对收集到的响应进行详细分析,我们发现所有模型都难以将新信息整合到现有回答中,也难以执行精确且无歧义的编辑。此外,我们发现模型难以判断其输出是否成功遵循了用户指令,其准确率与人类一致性相比至少低了 10 个百分点。我们的发现表明,KIWI 将成为衡量进展和提升 LLM 在知识密集型写作任务中指令遵循能力的宝贵资源。

关键词

引用

@article{arxiv.2403.03866,
  title  = {KIWI: A Dataset of Knowledge-Intensive Writing Instructions for Answering Research Questions},
  author = {Fangyuan Xu and Kyle Lo and Luca Soldaini and Bailey Kuehl and Eunsol Choi and David Wadden},
  journal= {arXiv preprint arXiv:2403.03866},
  year   = {2024}
}