中文

基于扩散模型的状态净化:面向交互式推荐中的层次强化学习公平性

机器学习 2026-03-05 v1 人工智能

摘要

交互式推荐系统(IRS)正越来越多地使用强化学习(RL)来捕捉用户-系统动态的序列性质。然而,现有的公平性感知方法常常存在根本性疏漏:它们假设观察到的用户状态是真实偏好忠实的表征。实际上,隐式反馈受到受人气驱动的噪声和曝光偏差的污染,导致状态失真,误导 RL 智能体。我们认为,准确性与公平性之间的持久冲突不仅仅是一个奖励塑形问题,而是一个状态估计失败问题。本文提出了 DSRM-HRL 框架,将公平性感知推荐重新表述为状态净化问题,再进行解耦的层次决策。我们引入基于扩散模型的去噪状态表示模块(DSRM),从高熵、嘈杂的交互历史中恢复低熵的潜在偏好流形。基于这个净化后的状态,采用层次强化学习(HRL)智能体来解耦冲突目标:高层策略调节长期公平性轨迹,而低层策略在这些动态约束下优化短期参与度。在高保真模拟器(KuaiRec、KuaiRand)上的大量实验表明,DSRM-HRL有效打破“富者不富者”反馈环,实现了推荐效用与曝光公平性之间的优越 Pareto 前沿。

关键词

引用

@article{arxiv.2603.03820,
  title  = {Fairness Begins with State: Purifying Latent Preferences for Hierarchical Reinforcement Learning in Interactive Recommendation},
  author = {Yun Lu and Xiaoyu Shi and Hong Xie and Xiangyu Zhao and Mingsheng Shang},
  journal= {arXiv preprint arXiv:2603.03820},
  year   = {2026}
}