中文

探索大语言模型在对话理解中的事实一致性

计算与语言 2024-04-02 v3

摘要

LLM(大语言模型,Large Language Models)通常以对话形式与用户交互,并遵循指令生成回复,这天然要求具备对话理解能力。然而,对话理解是一种难以直接评估的通用语言能力。本工作中,我们提出借助对话摘要任务,围绕事实一致性问题开展评估。除评估并分析不同LLM的对话摘要表现(DIAC-Sum)外,我们还从生成的摘要中导出事实性问题,将其作为更灵活的对话理解度量(DIAC-QA)。评估显示,LLM生成的摘要平均有26.8%存在事实不一致;即便所评估的最强模型ChatGPT,也有16%的摘要含此类错误。对于更具挑战性的事实问答,所有受评LLM的平均错误率为36.1%。两项结果均表明存在严重缺陷。详细分析显示,对话主客体理解对LLM仍具挑战性。此外,为激发并增强LLM的对话理解能力,我们提出一种基于自动构建多任务数据的微调范式,在DIAC-QA上实现了11%的相对错误率下降。

关键词

引用

@article{arxiv.2311.07194,
  title  = {Exploring the Factual Consistency in Dialogue Comprehension of Large Language Models},
  author = {Shuaijie She and Shujian Huang and Xingyun Wang and Yanke Zhou and Jiajun Chen},
  journal= {arXiv preprint arXiv:2311.07194},
  year   = {2024}
}

备注

Accepted at NAACL2024 Main