基于校准奖励的通用对抗后缀语言模型强化学习
计算与语言
2025-12-10 v1
摘要
语言模型对能够可靠改变预测的短对抗后缀具有脆弱性。以往的工作通常使用梯度搜索或基于规则的方法来找到此类后缀,但这些方法脆弱且常常局限于单个任务或模型。本文使用强化学习框架,其中将后缀视为策略,并通过原始策略优化(PPO)在冻结模型作为奖励oracle的情况下进行训练。通过校准交叉熵来塑造奖励,消除标签偏见并聚合表面形式以提高可迁移性。对方法进行评估,使用三个不同的语言模型:Qwen2-1.5B Instruct、TinyLlama-1.1B Chat和 Phi-1.5,在覆盖情感、自然语言推理、改写和常识推理的五个多样化NLP基准数据集上。结果表明,RL训练的后缀在一致地降低准确率,并且在类似任务和模型之间更有效地迁移 than 先前此类对抗触发器。
引用
@article{arxiv.2512.08131,
title = {Universal Adversarial Suffixes for Language Models Using Reinforcement Learning with Calibrated Reward},
author = {Sampriti Soor and Suklav Ghosh and Arijit Sur},
journal= {arXiv preprint arXiv:2512.08131},
year = {2025}
}
备注
5 pages