人类变异性 vs. 机器一致性:基于大语言模型文本的语言学分析
计算与语言
2024-12-05 v1
摘要
大语言模型(LLM)的快速发展显著提升了其生成自然语言的能力,使得由 LLM 生成的文本日益难以与人类撰写的文本区分。近期研究主要聚焦于利用 LLM 对文本进行分类,判定其为人类撰写或机器生成。本研究采取不同方法,通过基于 250 个独立语言特征的轮廓化�对文本进行分析。我们选取来自 SemEval 2024 Task 8 Subtask B 的 M4 数据集。我们自动计算各种语言特征,并额外测量每个文档的平均句法深度、语义相似性和情感内容。随后,我们对所有计算得到的特征进行二维 PCA 降维处理。我们的分析揭示了人类撰写的文本与 LLM 生成的文本之间存在显著差异,尤其在特征的变异性方面,我们发现人类撰写的文本变异性更高。这一差异在语言风格约束较为严格的文本类型中尤为明显。我们的发现表明,人类撰写的文本比 LLM 生成的文本更不要求高认知负荷,语义内容更丰富,情感内容更丰富。这些见解凸显了 incorporating 有意义的语言特征以增进对 LLM 输出文本理解的重要性。
引用
@article{arxiv.2412.03025,
title = {Human Variability vs. Machine Consistency: A Linguistic Analysis of Texts Generated by Humans and Large Language Models},
author = {Sergio E. Zanotto and Segun Aroyehun},
journal= {arXiv preprint arXiv:2412.03025},
year = {2024}
}