中文

HLB:评估大语言模型在语言使用中的人类化程度

计算与语言 2024-09-25 v1

摘要

随着合成数据在训练语言模型方面的应用日益增长,尤其是在通过生成对话数据方面,人们越来越担心这些模型可能偏离真实的人类语言模式,从而丧失人类沟通中固有的丰富性和创造性。这凸显了评估语言模型在实际语言使用中人类化程度的关键需求。本文提出了综合的人类化基准测试(HLB),通过 10 个心理语言学实验评估了 20 个大语言模型(LLMs)的核心语言方面,包括声音、词汇、语法、语义和语篇(见 https://huggingface.co/spaces/XufengDuan/HumanLikeness)。为锚定这些比较,我们收集了超过 2000 名人类参与者的响应,并将其与 LLM 的输出在这些实验中进行了比较。为进行严格的评估,我们开发了一种编码算法,准确识别语言使用模式,从而提取每个任务的响应分布。通过比较人类参与者和 LLM 之间的响应分布,我们通过分布相似性量化了人类化程度。我们的结果揭示了 LLM 在各种语言水平上复制人类响应的细粒度差异。重要的是,我们发现其他绩效指标的改进并不一定导致更大的人类化程度,在某些情况下甚至会导致下降。通过引入心理语言学方法进行模型评估,本基准测试提供了系统性评估 LLM 在语言使用中人类化程度的首个框架。

关键词

引用

@article{arxiv.2409.15890,
  title  = {HLB: Benchmarking LLMs' Humanlikeness in Language Use},
  author = {Xufeng Duan and Bei Xiao and Xuemei Tang and Zhenguang G. Cai},
  journal= {arXiv preprint arXiv:2409.15890},
  year   = {2024}
}