模型错位与语言变化:AI关联语言在非脚本化口语英语中的痕迹
计算与语言
2025-08-04 v1 人工智能
摘要
近年来,书面语言,特别是在科学和教育领域,出现了显著的词汇使用变化。这些变化广泛归因于大型语言模型(LLM)的日益影响,后者经常依赖独特的词汇风格。模型输出与目标受众规范之间的差异可被视为一种错位。尽管这些变化常与直接将人工智能(AI)用作文本生成工具有关,但是否反映了人类语言系统本身的更广泛变化仍不清楚。为探索此问题,我们构建了一个来自未脚本化口语数据集,包含来自科学和技术播客的2210万个单词。我们分析了2022年ChatGPT发布前后词汇趋势,重点关注常见的LLM关联词汇。我们的结果显示,2022年之后,这些词汇的使用出现中等但显著的增加,表明人类词汇选择趋向于LLM关联模式。相比之下,基线同义词没有出现显著的方向性变化。鉴于时间段较短且影响的词汇数量较大,这可能表示语言使用正在出现显著变化。无论是这种变化代表自然语言变�,还是由AI暴露驱动的新型变迁尚不明确。同样,虽然这些变化可能源于更广泛的采用模式,但也可能是上游训练错位最终导致人类语言使用的变化。这些发现与不对齐模型可能塑造社会和道德信念的伦理问题相呼应。
引用
@article{arxiv.2508.00238,
title = {Model Misalignment and Language Change: Traces of AI-Associated Language in Unscripted Spoken English},
author = {Bryce Anderson and Riley Galpin and Tom S. Juzek},
journal= {arXiv preprint arXiv:2508.00238},
year = {2025}
}
备注
Accepted at AIES 2025. To appear in the AIES Proceedings. 14 pages, 2 figures, 2 tables. Licensed under CC BY-SA 4.0