安全驾驭还是掉入悬崖?重新思考推理时干预的特定性与鲁棒性
机器学习
2026-02-09 v1 人工智能
计算与语言
摘要
模型干扰即指在推理时对隐藏表示进行干预,已成为一种轻量级的微调替代方案,用于精确控制大型语言模型。尽管对干扰效果有广泛研究,但是否仅改变预期属性的评估仍有限,尤其是对于与目标属性相关的意外行为变化。我们提出了一种框架,区分三个维度的特定性:通用性(保持流畅性和无关能力)、控制性(保持相关控制属性)以及鲁棒性(在分布迁移下保持控制属性)。我们研究了两个安全关键用例:通过减少过度拒绝和忠实性幻觉来引导模型,结果表明,尽管干扰实现了高效果且基本维持了通用性和控制性的特定性,但它始终未能保持鲁棒性的特定性。例如,在过度拒绝干扰方面,所有干扰方法都能降低过度拒绝,而不损害通用能力和对有害查询的拒绝;但它们会显著增加对越狱攻击的脆弱性。我们的工作提供了模型干扰中特定性的首次系统评估,表明标准的效果和特定性检查是不够的,因为在没有鲁棒性评估的情况下,干扰方法可能看起来可靠,实则可能捏造模型安全。
引用
@article{arxiv.2602.06256,
title = {Steering Safely or Off a Cliff? Rethinking Specificity and Robustness in Inference-Time Interventions},
author = {Navita Goyal and Hal Daumé},
journal= {arXiv preprint arXiv:2602.06256},
year = {2026}
}
备注
EACL 2026 Main, Long Paper