人类是否与大型语言模型一样脆弱?
计算与语言
2025-11-10 v2 人机交互
摘要
大型语言模型(LLM)的输出不稳定,这既源于解码过程的非确定性,也源于提示词的脆弱性。虽然 LLM 生成的内在非确定性可能通过输出分布的变化来模拟人类标注现有的不确定性,但关于提示词脆弱性是否独特于 LLM 的假设仍属未探索状态。这引出了一个问题:人类标注员是否对提示词的变化表现出类似的敏感性?如果是这样,是否应该认为 LLM 的提示词脆弱性是有问题的?或者,提示词脆弱性是否正确反映了人类标注的方差?为填补这一研究空白,我们系统比较了提示词修改对 LLM 和人类标注员相同指令修改的效果,聚焦于人类是否对提示词的扰动表现出类似的敏感性。为研究此问题,我们对人类和 LLM 对一组文本分类任务进行提示,条件是提示词的变体。我们的发现表明,无论是人类还是 LLM 都对特定类型的提示词修改表现出增加的脆弱性,尤其是涉及替代标签集合或标签格式替换的提示词修改。然而,人类判断的分布对拼写错误和标签顺序颠倒的影响小于 LLM。
引用
@article{arxiv.2509.07869,
title = {Are Humans as Brittle as Large Language Models?},
author = {Jiahui Li and Sean Papay and Roman Klinger},
journal= {arXiv preprint arXiv:2509.07869},
year = {2025}
}