没有普遍礼貌:基于PLUM语料库的跨语言、多模型礼节效应研究
计算与语言
2026-04-20 v1
摘要
本文探讨了大型语言模型(LLM)对用户提示中不同礼节程度的响应。Brown和Levinson的礼节理论以及Culpeper的不礼节框架是实验的基础,跨越三种语言(英语、印地语、西班牙语)、五个模型(Gemini-Pro、GPT-4o Mini、Claude 3.7 Sonnet、DeepSeek-Chat和Llama 3)以及用户之间三种交互历史(原始、礼貌和不礼貌)。我们的样本包含22,500对提示和响应的各种类型,按照八因素评估框架(连贯性、清晰度、深度、响应性、情境保持、毒性、简洁性和可读性)进行五级礼节评估。研究结果显示,模型性能高度受语气、对话历史和语言的影响。尽管礼貌提示可使平均响应质量提升最高可达约11%,不礼貌语气则会降低质量,但这些效应在语言和模型之间既不一致也不普遍。英语最适合礼貌或直接语气,印地语最适合谦逊和间接语气,西班牙语最适合自信语气。在模型中,Llama对语气最敏感(11.5%的幅度),而GPT对对抗性语气更稳健。这些结果表明,礼节是一种可量化的计算变量,影响LLM行为,但其影响是语言和模型依赖的,而非普遍的。为支持可重复性和后续工作,我们另外发布PLUM(Politeness Levels in Utterances, Multilingual),这是一套包含1500个在三种语言和五个礼节类别中经人类验证的提示语料库,并提供对六个可检验假设的正式补充分析,这些假设从礼节理论中推导,经数据集经验评估。
引用
@article{arxiv.2604.16275,
title = {No Universal Courtesy: A Cross-Linguistic, Multi-Model Study of Politeness Effects on LLMs Using the PLUM Corpus},
author = {Hitesh Mehta and Arjit Saxena and Garima Chhikara and Rohit Kumar},
journal= {arXiv preprint arXiv:2604.16275},
year = {2026}
}