中文

LLM 生成文本中的时间平坦化:人类与 LLM 写作轨迹比较

计算与语言 2026-04-15 v1

摘要

大型语言模型 (LLM) 越来越多地被用于日常应用,从内容生成到代码编写,每个交互都将模型视为无状态的,独立生成响应,却不记忆历史。然而,人类写作是内在的纵向过程:作者的风格和认知状态会在数月乃至数年间演变。这引出一个核心问题:LLM 能否在扩展的时间段内再现此类时间结构?我们构建并公开发布了一个由 412 位人类作者和 6,086 篇文档构成的纵向数据集,覆盖 2012--2024 年,包含三个领域(学术摘要、博客、新闻),并将其与三个代表性 LLM 在标准和 history-conditioned 生成设置下的输出进行比较。通过对语义、词汇和认知情感表示的漂移和方差指标进行分析,我们发现 LLM 生成文本存在时间平坦化。LLM 产生更大的词汇多样性,但在语义和认知情感漂移方面显著低于人类。这些差异高度具有预测性:仅凭时间可变性模式就能在区分人类与 LLM 轨迹方面实现 94% 的准确度和 98% 的 ROC-AUC。我们的结果表明,无论 LLM 是否在生成时访问增量历史,时间平坦化都持续存在,这揭示了当前部署范式的基本属性。这一差距直接影响需要真实时间结构的应用,如合成训练数据和纵向文本建模。

关键词

引用

@article{arxiv.2604.12097,
  title  = {Temporal Flattening in LLM-Generated Text: Comparing Human and LLM Writing Trajectories},
  author = {Zhanwei Cao and YeoJin Go and Yifan Hu and Shanu Sushmita},
  journal= {arXiv preprint arXiv:2604.12097},
  year   = {2026}
}

备注

25 pages, 6 figures. To appear in Findings of ACL 2026