凭笔礼程度影响大语言模型准确率
计算与语言
2025-10-07 v1 人工智能
机器学习
神经与进化计算
统计方法学
摘要
自然语言提示的措辞已被证明会影响大型语言模型(LLM)的性能,但礼貌程度和语气的作用尚未得到充分探讨。本研究 investigates 不同礼貌程度的提示如何影响模型在多选题上的准确率。我们创建了一个包含 50 个基础问题的数据集,涵盖数学、科学和历史学科,每个问题被改写为五种语气变体:非常礼貌、礼貌、中性、粗鲁、非常粗鲁,共生成 250 个独特提示。我们使用 ChatGPT 4o 对这些条件下的回答进行评估,并应用配对样本 t 检验来评估统计显著性。与预期不同,Impolite 提示在准确率上 consistently 优于礼貌提示,准确率从非常礼貌提示的 80.8% 高达非常粗鲁提示的 84.8%。这些发现不同于早前研究,后者将粗鲁与较差结果联系起来,表明较新的 LLM 对语气变化的反应方式可能不同。我们的结果突显了研究提示的语义方面重要性,并引发了关于人类-人工智能交互更广泛社会维度的问题。
引用
@article{arxiv.2510.04950,
title = {Mind Your Tone: Investigating How Prompt Politeness Affects LLM Accuracy (short paper)},
author = {Om Dobariya and Akhil Kumar},
journal= {arXiv preprint arXiv:2510.04950},
year = {2025}
}
备注
5 pages, 3 tables; includes Limitations and Ethical Considerations sections; short paper under submission to Findings of ACL 2025