中文

基于强化学习的无公式多任务融合推荐系统模型 xMTF

信息检索 2025-04-09 v1

摘要

推荐系统需要优化用户反馈的 various 类型,例如点击、点赞和分享。处理多种类型反馈的典型推荐系统具有两个组件:多任务学习 (MTL) 模块,预测如点击-through rate 和 like rate 的反馈;以及多任务融合 (MTF) 模块,将这些预测整合为用于项目排序的单一得分。MTF 对确保用户满意度至关重要,因为它直接影响推荐结果。最近已将强化学习应用于 MTF 任务以提高长期用户满意度。然而,现有的基于强化学习的 MTF 方法是公式化方法,仅在预定义公式中调整有限的系数。预定义公式限制了强化学习的搜索空间,并成为 MTF 的瓶颈。为克服这一问题,我们提出了一个无公式 MTF 框架。我们展示,任何合适的融合函数可表示为单变量单调函数的组合,正如 Sprecher 表示定理所述。借助这一点,我们引入一种新型可学习的单调融合细胞 (MFC) 来取代预定义公式。我们称这种新的 MFC 为模型 eXtreme MTF (xMTF)。此外,我们采用两种阶段混合 (TSH) 学习策略有效训练 xMTF。通过扩大 MTF 搜索空间,xMTF 在大量离线和在线实验中超越了现有方法。

关键词

引用

@article{arxiv.2504.05669,
  title  = {xMTF: A Formula-Free Model for Reinforcement-Learning-Based Multi-Task Fusion in Recommender Systems},
  author = {Yang Cao and Changhao Zhang and Xiaoshuang Chen and Kaiqiao Zhan and Ben Wang},
  journal= {arXiv preprint arXiv:2504.05669},
  year   = {2025}
}

备注

10 pages, 8 figues; WWW 2025 Accepted