中文

评估大语言模型在信息寻求对话中基于文档的回复生成

计算与语言 2023-09-22 v1 人工智能

摘要

本文研究了在信息寻求对话场景下,使用如 ChatGPT 之类的大语言模型(LLM)进行基于文档的回复生成。为评估,我们采用了此前用于 DialDoc 2022 共享任务的、涵盖四个社会服务领域的多文档任务导向对话语料库 MultiDoc2Dial。信息寻求对话轮次基于提供相关信息的多个文档。我们通过提示 ChatGPT 模型生成对话补全回复,使用两种方法:Chat-Completion 与 LlamaIndex。ChatCompletion 利用 ChatGPT 模型预训练知识,而 LlamaIndex 还从文档中提取相关信息。观察到基于文档的 LLM 回复生成无法被自动评价指标充分评估,因为它们显著更为冗长,我们进行了人工评估,由标注者对共享任务获胜系统、两种 ChatGPT 变体输出以及人类回复进行打分。尽管两种 ChatGPT 变体更可能包含相关片段中不存在的信息,可能伴有幻觉现象,它们的评分高于共享任务获胜系统与人类回复。

关键词

引用

@article{arxiv.2309.11838,
  title  = {Evaluating Large Language Models for Document-grounded Response Generation in Information-Seeking Dialogues},
  author = {Norbert Braunschweiler and Rama Doddipatla and Simon Keizer and Svetlana Stoyanchev},
  journal= {arXiv preprint arXiv:2309.11838},
  year   = {2023}
}

备注

10 pages