用于鲁棒 LLM 对齐的对抗偏好学习
机器学习
2025-06-02 v1 人工智能
摘要
现代语言模型通常依赖基于人类反馈的强化学习(RLHF)来引导安全行为。然而,由于三个关键局限性,它们仍易受对抗攻击影响:(1) 人工标注效率低且成本高昂,(2) 潜在对抗攻击种类繁多,(3) 存在反馈偏差与奖励黑客(reward hacking)风险。为应对这些挑战,我们引入了对抗偏好学习(APL),这是一种包含三项关键创新的迭代对抗训练方法。首先,基于模型内在偏好概率的直接有害性度量,消除了对外部评估的依赖。其次,条件生成攻击器合成针对特定输入的对抗变体。第三,具有自动化闭环反馈的迭代框架,通过发现和缓解漏洞实现持续适应。在 Mistral-7B-Instruct-v0.3 上的实验表明,APL 显著增强了鲁棒性,在基础模型上实现了 83.33% 的无害性胜率(由 GPT-4o 评估),将有害输出从 5.88% 降至 0.43%(由 LLaMA-Guard 测量),并根据 HarmBench 使攻击成功率最多降低 65%。值得注意的是,APL 保持了有竞争力的实用性,其 MT-Bench 得分为 6.59(与基线的 6.78 相当),对基础模型的 LC-WinRate 为 46.52%。
关键词
引用
@article{arxiv.2505.24369,
title = {Adversarial Preference Learning for Robust LLM Alignment},
author = {Yuanfu Wang and Pengyu Wang and Chenyang Xi and Bo Tang and Junyi Zhu and Wenqiang Wei and Chen Chen and Chao Yang and Jingfeng Zhang and Chaochao Lu and Yijun Niu and Keming Mao and Zhiyu Li and Feiyu Xiong and Jie Hu and Mingchuan Yang},
journal= {arXiv preprint arXiv:2505.24369},
year = {2025}
}
备注
Accepted at ACL2025 Findings