中文

人类与 ChatGPT 生成对话的语言学比较

计算与语言 2024-04-29 v3 人工智能 计算机与社会

摘要

本研究探讨了人类与 LLM 生成对话之间的语言学差异,使用 ChatGPT-3.5 生成的 19.5K 对话作为 EmpathicDialogues 数据集的伴侣。该研究采用语言查询与词频统计(LIWC)分析,在 118 个语言学类别上比较了 ChatGPT 生成的对话与人类对话。结果显示,人类对话具有更大的可变性和真实性,但 ChatGPT 在诸如社会过程、分析风格、认知、注意力焦点和积极情绪基调等类别上表现出色,这强化了近期关于 LLM “比人类更人性化”的发现。然而,在 ChatGPT 和人类对话之间,未发现积极或消极情感存在显著差异。对话嵌入的分类器分析表明,尽管对话中未明确提及情感,但情感效价被隐式编码。该研究还贡献了一个新颖的、伴侣性的 ChatGPT 生成对话数据集,该数据集由两个独立的聊天机器人之间的对话组成,旨在复制一个开放获取并在 AI 语言建模研究中广泛使用的人类对话语料库。我们的发现增进了对 ChatGPT 语言能力的理解,并为持续努力区分人类和 LLM 生成的文本提供了信息,这对于检测 AI 生成的伪造品、错误信息和虚假信息至关重要。

关键词

引用

@article{arxiv.2401.16587,
  title  = {A Linguistic Comparison between Human and ChatGPT-Generated Conversations},
  author = {Morgan Sandler and Hyesun Choung and Arun Ross and Prabu David},
  journal= {arXiv preprint arXiv:2401.16587},
  year   = {2024}
}

备注

Proceedings of the 4th International Conference on Pattern Recognition and Artificial Intelligence (ICPRAI), Jeju, Korea, 2024