中文

通过强化学习实现推荐中帕累托高效公平-效用权衡

信息检索 2022-01-04 v1

摘要

随着推荐系统在日常生活中触及并影响越来越多的人,推荐中的公平性问题变得愈发关键。在公平感知推荐中,现有多数算法方法主要通过在优化主推荐目标(如 CTR)时对公平水平施加约束来求解约束优化问题。虽然这缓解了不公平推荐的影响,但由于公平与效用之间的固有权衡,某方法的期望收益可能显著损害推荐准确性。这促使我们处理这些冲突目标并探索推荐中两者之间的最优权衡。一个显见的方法是寻求帕累托高效解以保证效用与公平之间的最优折中。此外,考虑到现实电商平台的诉求,若能泛化整个帕累托前沿,使决策者可根据当前业务需要指定某一目标相对于另一目标的任意偏好,则更为可取。因此,本工作中我们提出一种使用多目标强化学习的公平感知推荐框架,称为 MoFIR,其能够针对所有可能偏好空间上的最优推荐策略学习单一的参数化表示。特别地,我们通过引入条件网络改进传统 DDPG,使网络直接以这些偏好为条件并输出 Q 值向量。在若干真实推荐数据集上的实验验证了我们的框架相较于所有其他基线在公平指标与推荐度量上的优越性。我们还提取了由 MoFIR 生成的真实数据集上的近似帕累托前沿,并与最先进的公平方法进行比较。

关键词

引用

@article{arxiv.2201.00140,
  title  = {Toward Pareto Efficient Fairness-Utility Trade-off inRecommendation through Reinforcement Learning},
  author = {Yingqiang Ge and Xiaoting Zhao and Lucia Yu and Saurabh Paul and Diane Hu and Chu-Cheng Hsieh and Yongfeng Zhang},
  journal= {arXiv preprint arXiv:2201.00140},
  year   = {2022}
}