大语言模型中的言语习惯现象:面向前沿模型的系统性分析
摘要
随着大语言模型(LLMs)通过强化学习从人类反馈(RLHF)和宪法 AI 等对齐技术不断演进,一个日益显著且令人注意的现象正在出现:言语习惯的扩散,这些习惯是重复的、公式化的语言模式遍布模型输出。它们范围从讨论式开场白(That's a great question!, Awesome!)到伪同情肯定(I completely understand your concern, I'm right here to catch you)以及过度使用的词汇(delve, tapestry, nuanced)。本文对言语习惯现象进行系统性分析,涵盖八个前沿 LLMs:GPT-5.4、Claude Opus 4.7、Gemini 3.1 Pro、Grok 4.2、Doubao-Seed-2.0-pro、Kimi K2.5、DeepSeek V3.2 和 MiMo-V2-Pro。我们构建了用于标准化 API 基于评估的框架,评估 10,000 个提示,涵盖 10 个任务类别,中英文共 160,000 个模型响应。我们引入言语习惯指数(VTI),用于量化习惯的流行度,并分析其与讨论程度、词汇多样性和人类感知自然性之间的相关性。我们的发现显示,模型间存在显著差异:Gemini 3.1 Pro 表现出最高的 VTI(0.590),而 DeepSeek V3.2 实现最低(0.295)。我们进一步证明了言语习惯在多轮对话中会累积,主观任务中被放大,并且显示出不同的跨语言模式。人类评估(N = 120)确认了讨论程度与感知自然性之间的强烈负相关(r = -0.87, p < 0.001)。这些结果凸显了当前训练范式的对齐代价,并突显了更真实的人机交互框架的紧迫需求。
引用
@article{arxiv.2604.19139,
title = {The Rise of Verbal Tics in Large Language Models: A Systematic Analysis Across Frontier Models},
author = {Shuai Wu and Xue Li and Yanna Feng and Yufang Li and Zhijun Wang and Ran Wang},
journal= {arXiv preprint arXiv:2604.19139},
year = {2026}
}
备注
20 pages, 17 figures, 8 tables; code and data available at https://github.com/Noah-Wu66/Vectaix-Research; DOI: 10.5281/zenodo.19767626