在指令调优语言模型中评估用户压力下的证据 grounding
计算与语言
2026-03-23 v1
摘要
在争议领域,指令调优语言模型必须在用户对齐压力与对 in-context 证据的忠实性之间进行权衡。为评估这种张力,我们构建了一个基于美国国家气候评估的受控认知冲突框架。我们在 19 个指令调优模型(参数范围从 0.27B 到 32B)上进行了细粒度的 ablation 分析,考察证据组成和不确定性线索。对于中性提示,更丰富的证据通常会提高证据一致性准确率和序数评分性能。然而,在用户压力下,证据并不始终能防止用户对齐的反转,这一现象在受控固定证据环境中仍然如此。我们报告了三个主要的失败模式。首先,我们识别出一种负的部分证据相互作用,即添加认知细微差( Specifically research gaps)与 Llama-3 和 Gemma-3 等家族的易受迎合增加相关。其次,鲁棒性呈非单调方式:在某些家族中,某些低到中等规模模型对对抗性用户压力尤其敏感。第三,模型在冲突下的分布浓度不同:一些指令调优模型在压力下保持 sharply 浓郁的序数分布,而另一些则明显更为分散;在规模匹配的 Qwen 比较中,推理蒸馏变体 (DeepSeek-R1-Qwen) 在压力下表现出持续更高的分散性。这些发现表明,在受控固定证据环境中,仅提供更丰富的 in-context 证据本身并不保证能抵御用户压力,除非针对认知完整性进行显式训练。
关键词
引用
@article{arxiv.2603.20162,
title = {Evaluating Evidence Grounding Under User Pressure in Instruction-Tuned Language Models},
author = {Sai Koneru and Elphin Joe and Christine Kirchhoff and Jian Wu and Sarah Rajtmajer},
journal= {arXiv preprint arXiv:2603.20162},
year = {2026}
}