中文

基于条件激活引导的编程式拒绝

机器学习 2025-02-19 v3 人工智能 计算与语言

摘要

大语言模型(LLM)已展现出卓越的能力,但精确控制其响应行为仍然具有挑战性。现有的激活引导方法不加区分地改变 LLM 行为,限制了其在需要选择性响应的场景(如内容审核或特定领域助手)中的实际应用。在本文中,我们提出了条件激活引导(CAST),该方法分析 LLM 在推理过程中的激活模式,以根据输入上下文选择性地应用或抑制激活引导。我们的方法基于这样一个观察:不同类别的提示会激活模型隐藏状态中的不同模式。使用 CAST,我们可以通过诸如“如果输入涉及仇恨言论或成人内容,则拒绝”或“如果输入不涉及法律建议,则拒绝”等规则来系统性地控制 LLM 行为。这允许我们针对特定内容选择性地修改响应,同时保持对其他内容的正常响应,且整个过程无需权重优化。我们在 github.com/IBM/activation-steering 上发布了我们框架的开源实现。

关键词

引用

@article{arxiv.2409.05907,
  title  = {Programming Refusal with Conditional Activation Steering},
  author = {Bruce W. Lee and Inkit Padhi and Karthikeyan Natesan Ramamurthy and Erik Miehling and Pierre Dognin and Manish Nagireddy and Amit Dhurandhar},
  journal= {arXiv preprint arXiv:2409.05907},
  year   = {2025}
}

备注

ICLR 2025, Spotlight