中文

解码AI作者身份:大语言模型能否跨文学与政治模拟人类风格?

计算与语言 2026-04-14 v1 机器学习

摘要

在生成式AI模仿特定人类风格能力日益提升的背景下,本研究探讨了最先进大语言模型(LLM),包括 GPT-4o、Gemini 1.5 Pro 和 Claude Sonnet 3.5,能够否模拟显著文学与政治人物的作者签名:Walt Whitman、William Wordsworth、Donald Trump 和 Barack Obama。我们采用严格的主题对齐零样本提示框架,生成合成语料库,并通过结合基于转换器的分类(BERT)和可解释机器学习(XGBoost)的评估框架进行评估。我们的 methodology 集成了 Linguistic Inquiry and Word Count(LIWC)标记、困惑度和可读性指标,以评估AI生成文本与人类作者文本之间的差异。结果表明,AI生成的模仿仍高度可检测,基于受限的八个风格计量特征训练的 XGBoost 模型实现的准确率与高维神经分类器相当。特征重要性分析确定困惑度作为主要判别指标,揭示了AI输出在随机正则性方面存在显著差异,与人类写作的更高变异性相对比。尽管LLMs在低维启发式特征(如句法复杂度和可读性)上表现出分布收敛,但尚未完全复制人类作者语料库中固有的情感密度和风格变异性。通过隔离当前生成式模仿的具体统计差距,本研究为LLM风格行为提供了全面的基准,并为数字人文和社交媒体中的作者归属提供了关键见解。

关键词

引用

@article{arxiv.2603.23219,
  title  = {Decoding AI Authorship: Can LLMs Truly Mimic Human Style Across Literature and Politics?},
  author = {Nasser A Alsadhan},
  journal= {arXiv preprint arXiv:2603.23219},
  year   = {2026}
}

备注

Preprint. Accepted for publication in Digital Scholarship in the Humanities (OUP)