中文

基于多目标决策转换器的生成式顺序通知优化

机器学习 2025-09-03 v1 人工智能

摘要

通知是传递及时和相关信息的重要通信渠道。优化其投递涉及在诸多约束下(如消息效用和用户疲劳)解决复杂的序列决策问题。离线强化学习(RL)方法,如保守Q学习(CQL),已应用于此问题,但在规模化场景下面临实际挑战,包括不稳定性、对分布迁移的敏感性、可重复性有限以及在高维推荐设置中解释性困难。我们提出一种基于决策转换器(Decision Transformer, DT)的框架,将策略学习重新表述为返回条件监督学习,从而提高鲁棒性、可扩展性和建模灵活性。我们的贡献包括与CQL的真实世界比较、适用于非episodic任务的多奖励设计、用于返回到-go条件的分位数回归方法,以及具备循环缓冲区序列处理以实现近实时推理的生产就绪系统。在部署的通知系统中的大规模离线和在线实验表明,我们的方法在提高通知效用和整体会话活动的同时,最大限地降低了用户疲劳。相较于基于多目标CQL的智能体,我们的方法在LinkedIn的通知决策中实现了+0.72%的会话量提升,使通知推荐更加相关。

关键词

引用

@article{arxiv.2509.02458,
  title  = {Generative Sequential Notification Optimization via Multi-Objective Decision Transformers},
  author = {Borja Ocejo and Ruofan Wang and Ke Liu and Rohit K. Patra and Haotian Shen and David Liu and Yiwen Yuan and Gokulraj Mohanasundaram and Fedor Borisyuk and Prakruthi Prabhakar},
  journal= {arXiv preprint arXiv:2509.02458},
  year   = {2025}
}