中文

GREAT:通过情感感知触发器合成实现RLHF中的可泛化后门攻击

密码学与安全 2025-10-13 v1 机器学习

摘要

近期研究表明RLHF极易受到后门攻击,即在偏好数据中注入恶意触发器的投毒方案。然而,现有方法通常依赖静态的、基于稀有令牌的触发器,限制了其在真实场景中的有效性。本文开发了GREAT,一个通过情感感知触发器合成在RLHF中构建可泛化后门的新框架。具体而言,GREAT针对由语义暴力请求和情感愤怒触发器共同特征定义的有害用户子群。GREAT的核心是一个在潜在嵌入空间中运作的触发器识别流水线,利用主成分分析和聚类技术来识别最具代表性的触发器。为实现这一点,我们呈现了Erinyes,一个从GPT-4.1中精心策划的高质量数据集,包含超过5000个愤怒触发器,采用原则性、分层性和促进多样性的方法。在基准RLHF数据集上的实验表明,GREAT在攻击成功率上显著优于基线方法,尤其是在未见触发器场景下,同时在良性输入上的响应质量基本得以保持。

关键词

引用

@article{arxiv.2510.09260,
  title  = {GREAT: Generalizable Backdoor Attacks in RLHF via Emotion-Aware Trigger Synthesis},
  author = {Subrat Kishore Dutta and Yuelin Xu and Piyush Pant and Xiao Zhang},
  journal= {arXiv preprint arXiv:2510.09260},
  year   = {2025}
}