中文

通过对抗性RLHF平台实现LLM失对齐

机器学习 2025-03-06 v1 人工智能

摘要

强化学习在将语言模型与人类偏好对齐方面已展现出显著性能,推动了对开发RLHF平台的关注。这些平台使用户无需任何复杂机器学习算法开发专业知识即可进行模型微调。尽管这些平台提供了奖励建模和RLHF微调等有用功能,但其安全性和可靠性在很大程度上尚未被探索。鉴于RLHF和开源RLHF框架的日益普及,我们调查了这些系统的可信度及其对LLM行为的潜在影响。在本文中,我们提出了一种针对公开可用RLHF工具的攻击。在我们的攻击中,一个对抗性RLHF平台通过选择性操纵偏好数据集中的数据样本来破坏LLM对齐过程。在此场景中,当用户的任务与攻击者目标一致时,平台操纵包含与攻击者目标相关样本的偏好数据集子集。这种操纵导致损坏的奖励模型,最终导致语言模型失对齐。我们的结果表明,此类攻击可以有效引导LLM在目标领域内产生不良行为。我们的工作强调了探索RLHF平台漏洞及其在RLHF微调过程中对LLM对齐造成失对齐的潜在影响的迫切需要。

关键词

引用

@article{arxiv.2503.03039,
  title  = {LLM Misalignment via Adversarial RLHF Platforms},
  author = {Erfan Entezami and Ali Naseh},
  journal= {arXiv preprint arXiv:2503.03039},
  year   = {2025}
}