中文

充分的偏移量:通过针对性表示微调降低对齐语言模型的过度拒绝

机器学习 2025-07-08 v1 人工智能

摘要

安全对齐对于大型语言模型 (LLM) 抵抗恶意指令至关重要,但常常导致过度拒绝,即对善意提示不必要地被拒绝,从而损害用户体验和模型实用性。我们引入了 ACTOR (Activation-Based Training for Over-Refusal Reduction),一个稳健且计算和数据高效的训练框架,通过利用来自多样化查询的内部激活模式来最小化过度拒绝。ACTOR精确识别和调整触发拒绝的激活组件,提供对拒绝机制的更强控制。通过仅微调单个模型层,ACTOR能在多个基准测试中有效减少过度拒绝,同时保持模型处理恶意查询的能力并保持整体实用性。

关键词

引用

@article{arxiv.2507.04250,
  title  = {Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning},
  author = {Mahavir Dabas and Si Chen and Charles Fleming and Ming Jin and Ruoxi Jia},
  journal= {arXiv preprint arXiv:2507.04250},
  year   = {2025}
}