语气是否改变答案?评估现代 LLMs 上的提示礼貌性效应:GPT、Gemini 和 LLaMA
计算与语言
2026-03-31 v2 人工智能
摘要
提示工程已成为影响大语言模型 (LLM) 性能的关键因素,但语言语气和礼貌性等语用要素的影响仍未被充分探索,特别是在不同模型系列之间。在本工作中,我们提出了一种系统评估框架,用于检验交互语气如何影响模型准确率,并将其应用于三个最近发布且广泛可用的 LLM:GPT-4o mini (OpenAI)、Gemini 2.0 Flash (Google DeepMind) 和 Llama 4 Scout (Meta)。使用 MMMLU 基准测试,我们在涵盖 STEM 和人文学科领域的六项任务上评估了模型在非常礼貌、中性和非常粗鲁提示变体下的表现,并通过统计显著性检验分析了成对准确率差异。结果表明,语气敏感性既依赖于模型也依赖于领域。中性或非常礼貌的提示通常比非常粗鲁的提示获得更高的准确率,但统计显著的效应仅出现在部分人文学科任务中,其中粗鲁语气降低了 GPT 和 Llama 的准确率,而 Gemini 相比之下对语气不敏感。当在每个领域内跨任务聚合性能时,语气效应减弱并在很大程度上失去统计显著性。与早期研究相比,这些发现表明数据集规模和覆盖范围实质性地影响语气效应的检测。总体而言,我们的研究表明,虽然交互语气在特定的解释性设置中可能很重要,但现代 LLM 在典型的混合领域使用中普遍对语气变化具有鲁棒性,为实际部署中的提示设计和模型选择提供了实践指导。
引用
@article{arxiv.2512.12812,
title = {Does Tone Change the Answer? Evaluating Prompt Politeness Effects on Modern LLMs: GPT, Gemini, and LLaMA},
author = {Hanyu Cai and Binqi Shen and Lier Jin and Lan Hu and Xiaojing Fan},
journal= {arXiv preprint arXiv:2512.12812},
year = {2026}
}