中文

基于未来条件的多目标可控决策Transformer推荐

信息检索 2025-01-14 v1

摘要

确保长期成功是推荐系统的最终目标,这需要能够预见并塑造决策对未来用户满意度影响的策略。当前的推荐策略面临两个重大障碍。首先,推荐决策的未来影响仍然模糊不清,使得通过直接优化即时指标来评估它们变得不切实际。其次,多个目标之间经常出现冲突,例如提高准确性与探索多样化推荐。现有策略陷入“训练、评估和再训练”的循环中,随着目标的演变变得越来越劳动密集。为了解决这些挑战,我们引入了一种面向多目标可控推荐的未来条件策略,允许直接指定未来目标,并使模型能够自回归地生成与这些目标一致的项目序列。我们提出了多目标可控决策Transformer(MocDT),这是一种离线强化学习模型,能够利用大量离线数据自主学习从多个目标到项目序列的映射。因此,它可以在推理阶段根据任何指定的目标生成推荐。我们的实证结果强调了可控推荐策略能够根据不同目标生成项目序列,同时在与当前推荐策略的各种目标对比中保持有竞争力的性能。

关键词

引用

@article{arxiv.2501.07212,
  title  = {Future-Conditioned Recommendations with Multi-Objective Controllable Decision Transformer},
  author = {Chongming Gao and Kexin Huang and Ziang Fei and Jiaju Chen and Jiawei Chen and Jianshan Sun and Shuchang Liu and Qingpeng Cai and Peng Jiang},
  journal= {arXiv preprint arXiv:2501.07212},
  year   = {2025}
}