抵抗纠正:RLHF 如何使语言模型在自然对话中忽视外部安全信号
计算与语言
2026-01-15 v1 人工智能
摘要
语言模型的安全架构日益依赖外部监控器在推理时检测错误并注入纠正信号。为此类系统在交互式环境中发挥作用,模型必须能够将外部提供的置信度信息纳入其语言响应。本文测试了指令调优后语言模型在不同交互模式下是否保留这种可控性。我们在使用 Llama-3.2-3B 在 GSM8K 上的实验中,进行了因果干预研究,在其中显式注入外部置信度信号并测量模型在多种提示策略下的合规情况。我们发现,基础模型表现出近乎完美的可控性(斯佩棕 rho 接近 1.0),而指令调优模型却呈现出显著的情境依赖性:在明确命令提示下,模型完全遵循外部纠正(偏差约 0%,rho = 0.93),但在自然对话查询中则系统性地忽略相同信号(偏差增加 40%,rho = 0.04)。这种行为并非能力缺陷——模型能够处理该信号,但源自 RLHF 优化的一种新现象:该优化倾向于在自然对话中优先考虑对话流畅性而非外部校准线索。在我们进一步表明的小型模型中,内部 token 级别的置信度几乎无信息量(r = 0.035),这凸显了外部监督的必要性。我们的发现揭示了一个关键性部署失效模式:用户期望的交互方式恰恰是外部安全纠正最为无效的地方。
引用
@article{arxiv.2601.08842,
title = {Resisting Correction: How RLHF Makes Language Models Ignore External Safety Signals in Natural Conversation},
author = {Felipe Biava Cataneo},
journal= {arXiv preprint arXiv:2601.08842},
year = {2026}
}