真实还是机械?评估 LLM 能否准确模拟对话中人类回复的特质
计算与语言
2024-09-18 v2 计算机与社会
人机交互
摘要
由于需要招募、培训研究参与者并从中收集数据,研究和构建对话任务的数据集既昂贵又耗时。作为回应,许多近期工作试图使用大语言模型(LLM)来模拟人类与人类以及人类与 LLM 的交互,因为已证明 LLM 能在许多场景下生成令人信服的类人文本。然而,基于 LLM 的模拟在多大程度上\textit{实际上}反映了人类对话?在本工作中,我们通过从 WildChat 数据集生成包含 100,000 对 LLM-LLM 与人类-LLM 对话的大规模数据集,并量化 LLM 模拟与其人类对应方的吻合程度来回答这一问题。总体而言,我们发现模拟与人类交互之间的吻合度较低,表明在风格和内容等多个文本属性上存在系统性差异。此外,在英语、中文和俄语对话的比较中,我们发现模型的表现相似。我们的结果表明,当人类自身的书写方式更接近 LLM 自身的风格时,LLM 通常表现更好。
引用
@article{arxiv.2409.08330,
title = {Real or Robotic? Assessing Whether LLMs Accurately Simulate Qualities of Human Responses in Dialogue},
author = {Jonathan Ivey and Shivani Kumar and Jiayu Liu and Hua Shen and Sushrita Rakshit and Rohan Raju and Haotian Zhang and Aparna Ananthasubramaniam and Junghwan Kim and Bowen Yi and Dustin Wright and Abraham Israeli and Anders Giovanni Møller and Lechen Zhang and David Jurgens},
journal= {arXiv preprint arXiv:2409.08330},
year = {2024}
}