中文

语言模型生成中的共指鸿沟

计算与语言 2024-04-04 v2 人机交互

摘要

有效对话需要共同基础:参与者间的共享理解。然而,共同基础并非在对话中自发涌现。说话者与听者协力辨识并建构共享基础,同时避免误解。为实现共指,人类依赖一系列对话行为,如澄清(你指什么?)与确认(我明白了。)。但尚不清楚大语言模型(LLMs)生成的文本是否反映人类共指。为此,我们整理一组共指行为并提出量化尝试共指相应指标。我们研究 LLM 生成是否含共指行为,从若干对话数据集模拟轮次交替并与人类比较。我们发现——相较人类——LLM 生成语言的对话共指更少,反而生成看似简单预设共同基础的文本。为理解所识别共指鸿沟的根源,我们考察指令微调与偏好优化的作用,发现以当代偏好数据训练导致生成共指行为减少。总之,我们强调需更多研究考察人-AI 交互中的对话共指。

关键词

引用

@article{arxiv.2311.09144,
  title  = {Grounding Gaps in Language Model Generations},
  author = {Omar Shaikh and Kristina Gligorić and Ashna Khetan and Matthias Gerstgrasser and Diyi Yang and Dan Jurafsky},
  journal= {arXiv preprint arXiv:2311.09144},
  year   = {2024}
}

备注

NAACL 2024; 18 pages, 2 figures