鲁棒性悖论:在高风险决策中将基于规则的逻辑与情感噪声解耦
摘要
尽管大语言模型(LLM)被广泛记录为对微小的提示扰动敏感且易于产生谄媚对齐,但它们在重要的、受规则约束的决策中的鲁棒性仍未得到充分探索。我们发现了一个惊人的“鲁棒性悖论”:尽管LLM具有已知的词汇脆弱性,但对齐的LLM在受规则约束的制度性决策中对情感框架效应表现出强大的鲁棒性。使用跨三个高风险领域(医疗、金融和教育)的受控扰动框架,我们发现效应量可忽略不计(Cohen's h = 0.003),而类似的人类情境中观察到显著偏差(h在[0.3, 0.8]之间),大约小两个数量级。这种不变性在八个具有不同训练范式的模型中持续存在,表明驱动谄媚和提示敏感性的机制并未转化为逻辑约束满足的失败。虽然LLM可能对查询的格式“脆弱”,但它们似乎在情感上试图影响规则约束决策的稳定性方面要稳定得多。为了探究这一发现的边界,我们增加了两项由评审员驱动的辅助研究。一个五场景的移民延期产生了微小但统计上可检测的+0.8个百分点偏移,该偏移仍保持在预先指定的+/-3个百分点实际等效区域(ROPE)内,而一个筛选级别的对抗性叙事试点发现在更强的LLM生成提示下没有有意义的决策偏移。我们发布了一个核心基准(9个基础场景 x 18个条件变体 = 162个独特提示)、代码和数据,以促进可复现的评估。
引用
@article{arxiv.2601.21439,
title = {The Paradox of Robustness: Decoupling Rule-Based Logic from Affective Noise in High-Stakes Decision-Making},
author = {Jon Chun and Katherine Elkins},
journal= {arXiv preprint arXiv:2601.21439},
year = {2026}
}
备注
47 pages, 14 figures, 23 tables. Substantially revised from v1: added immigration domain extension (14,183 cells), adversarial narrative pilot (2,054 cells), reasoning-trace analysis, scaffolding decomposition. Total: 84,245 valid responses across 13 experiments. Under review at TMLR. Code and data will be released upon publication