面向可信赖性的上下文工程:混合与不当上下文下的 Rescorla-Wagner 引导
计算与语言
2025-09-08 v1 人工智能
摘要
融入外部上下文可以显著提升大型语言模型 (LLM) 的回复质量。然而,现实世界的上下文通常将相关信息与不成比例的不当内容混合在一起,带来可靠性风险。LLM 如何处理并优先考虑混合上下文?为了研究这一点,我们引入了 Poisoned Context Testbed,将查询与包含相关和不当内容的现实世界上下文配对。受动物联想学习的启发,我们将神经科学中的 Rescorla-Wagner (RW) 模型进行调整,以量化竞争性上下文信号如何影响 LLM 的输出。我们调整后的模型揭示了一致的行为模式:LLM 表现出强烈的倾向去融入在上下文中不那么普遍的信息。这种易感性在现实环境中是有害的,其中少量不当内容就能大幅降低回复质量。在我们的测试平台上的实证评估进一步证实了这一脆弱性。为了解决这个问题,我们引入了 RW-Steering,这是一种基于两阶段微调的方法,使模型能够内部识别并忽略不当信号。与之前依赖跨不同上下文混合进行广泛监督的方法不同,RW-Steering 在不同比例的不当内容中都能稳健地泛化。实验表明,我们最好的微调模型将回复质量提高了 39.8%,并扭转了不良行为曲线,确立了 RW-Steering 作为一种稳健、可泛化的上下文工程解决方案,以提升 LLM 在现实使用中的安全性。
引用
@article{arxiv.2509.04500,
title = {Context Engineering for Trustworthiness: Rescorla Wagner Steering Under Mixed and Inappropriate Contexts},
author = {Rushi Wang and Jiateng Liu and Cheng Qian and Yifan Shen and Yanzhou Pan and Zhaozhuo Xu and Ahmed Abbasi and Heng Ji and Denghui Zhang},
journal= {arXiv preprint arXiv:2509.04500},
year = {2025}
}
备注
36 pages, 7 figures