中文

语气是否影响 LLM 性能?

人工智能 2026-05-29 v1 计算与语言 人机交互

摘要

大语言模型(LLM)的应用日益增长,但其性能观察到会因提示风格和语气而有所不同。本研究探讨了提示中语气变体是否及如何导致 LLM 准确率存在差异。我们使用两个数据集:一个包含五个语气变体的 50 题基础问题数据集,以及一个覆盖 57 个学科、每个学科有七个语气变体的 570 题 MMLU 子集。实验评估了四个成本效益高的流行 LLM:ChatGPT-4o、ChatGPT-5-nano、Gemini 2.5 Flash 和 Gemini 2.5 Flash Lite。在所有模型中,语气效应是系统性的,但高度依赖于模型。一些模型表现出小而显著的变化,而另一些模型则在不同语气之间表现出大幅准确率波动。进一步,我们识别出学科层面的语气敏感性差异,并提出一种路由框架来解释语气如何影响内部推理模式。我们的发现警示用户不要假设 LLM 在部署时具有语气不敏感的可靠性。

关键词

引用

@article{arxiv.2605.29027,
  title  = {Mind Your Tone: Does Tone Alter LLM Performance?},
  author = {Om Dobariya and Akhil Kumar},
  journal= {arXiv preprint arXiv:2605.29027},
  year   = {2026}
}

备注

10 pages, 6 tables, 1 figure. Accepted as a full paper at the Thirty-second Americas Conference on Information Systems (AMCIS 2026), Reno. Follow-up to arXiv:2510.04950