中文

GRADE:通过自适应Dirichlet探索的组相对强化学习实现个性化多任务融合

机器学习 2025-10-13 v2

摘要

在现代推荐和搜索系统中,平衡多个目标对用户满意度至关重要,然而当前的多任务融合(MTF)方法依赖于静态的、手动调优的权重,无法捕捉个体用户意图。虽然强化学习(RL)提供了个性化的途径,但传统方法往往因训练不稳定以及这些大规模系统中固有的稀疏奖励而受挫。为解决这些局限性,我们提出自适应Dirichlet探索的组相对强化学习(GRADE),一种新颖且鲁棒的个性化多任务融合框架。GRADE利用无评论家的组相对策略优化(GRPO)范式,通过评估候选权重组的相对性能实现稳定高效的策略学习。其核心创新包括利用Dirichlet分布对权重空间进行原则性和结构化的探索,以及一个复合奖励函数,将稀疏用户反馈与密集模型先验和基于规则的约束相结合,以有效引导搜索。在拥有数亿日活跃用户的应用内市场中部署后,GRADE显著优于现有基线,在严格的大规模A/B测试中取得了显著提升:点击率(CTR)+0.595%,转化率(CVR)+1.193%,每千次展示收入(OPM)+1.788%,总订单量+1.568%。凭借其强劲表现,GRADE已在快手的应用市场搜索场景中全面部署,服务数亿用户。

关键词

引用

@article{arxiv.2510.07919,
  title  = {GRADE: Personalized Multi-Task Fusion via Group-relative Reinforcement Learning with Adaptive Dirichlet Exploration},
  author = {Tingfeng Hong and Pingye Ren and Xinlong Xiao and Chao Wang and Chenyi Lei and Wenwu Ou and Han Li},
  journal= {arXiv preprint arXiv:2510.07919},
  year   = {2025}
}