Token Buncher:遮蔽LLM免疫有害强化学习微调
机器学习
2026-05-12 v3 计算与语言
摘要
随着大型语言模型(LLM)能力的不断提升,通过微调进行有害滥用的风险也随之增加。虽然大多数先前研究假设攻击者依赖监督式微调(SFT)进行此类滥用,但我们系统性地证明了在匹配计算预算下,强化学习(RL)能够更有效地突破安全对齐,实现更高级的有害任务辅助。在应对这一新兴威胁方面,我们提出了 TokenBuncher,即首个针对 RL 基于有害微调的有效防御措施。TokenBuncher 通过约束模型响应熵来遮蔽 RL 赖以运行的基础。通过限制熵值,RL 式微调便无法利用不同的奖励信号来驱动模型趋向有害行为。我们通过熵即奖励的 RL 以及设计的Token Noiser机制实现了这一防御,以防止有害能力的升级。广泛的实验显示,TokenBuncher 在多种模型和 RL 算法上都能稳健地缓解有害 RL 微调,同时保持良好的 benign 任务性能和可微调性。我们的结果表明,RL 式有害微调的系统性风险大于 SFT,而 TokenBuncher 提供了有效且通用的防御。
关键词
引用
@article{arxiv.2508.20697,
title = {Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning},
author = {Weitao Feng and Lixu Wang and Peizhuo Lv and Tianyi Wei and Jie Zhang and Chongyang Gao and Sinong Zhan and Wei Dong},
journal= {arXiv preprint arXiv:2508.20697},
year = {2026}
}
备注
Project Hompage: https://tokenbuncher.github.io/