中文

高效而隐蔽:通过双层受限强化学习重思序贯推荐中的剂量污染

机器学习 2025-12-23 v4 人工智能

摘要

序贯推荐系统通过利用用户交互序列来探索动态用户意图,容易受到对抗性攻击。虽然现有攻击主要依赖数据投毒,但需要大规模用户访问或伪造轮廓,因而缺乏实用性。本文聚焦于剂量污染攻击,通过微调部分用户交互来诱导特定的错误预测。先前的 PPA 方法存在两个局限:i) 过度依赖序列时段影响限制了对物品转换的细粒度扰动,ii) 整体修改导致可检测的分布偏移。为解决这些挑战,我们提出了一种受限强化驱动的攻击方法 CREAT,将双层优化框架与多奖励强化学习相结合,以平衡对抗性效果与隐蔽性。我们首先开发了模式平衡奖励政策,集成模式反转奖励以反转关键模式,通过不平衡协最优运输最小化可检测偏移。随后,我们采用受限分组相对强化学习范式,通过动态屏障约束和分组共享经验回放实现逐步扰动,实现针对性污染并保持最小可检测性。大量实验表明 CREAT 的有效性。

关键词

引用

@article{arxiv.2511.09392,
  title  = {Potent but Stealthy: Rethink Profile Pollution against Sequential Recommendation via Bi-level Constrained Reinforcement Paradigm},
  author = {Jiajie Su and Zihan Nan and Yunshan Ma and Xiaobo Xia and Xiaohua Feng and Weiming Liu and Xiang Chen and Xiaolin Zheng and Chaochao Chen},
  journal= {arXiv preprint arXiv:2511.09392},
  year   = {2025}
}