SaFRO:基于双相对政策优化的满足感感知融合用于短视频搜索
人工智能
2026-03-23 v1 系统与控制
系统与控制
摘要
多任务融合在工业短视频搜索系统中发挥着关键作用,通过聚合来自异构预测信号于统一的排序得分。然而,现有方法主要针对即时参与度指标进行优化,这些指标往往难以与长期用户满意度保持一致。虽然强化学习(RL)为用户满意度优化提供了可行的途径,但其直接应用于搜索场景由于数据稀疏和意图约束,与推荐 feed 的情况不同具挑战。为此,我们提出了 SaFRO,一个旨在优化用户满意度的新型框架。我们首先构建了一个满足感感知奖励模型,该模型利用查询级别的行为代理捕获项目级别交互之外的整体用户满意度。随后,我们引入双相对政策优化(DRPO),这是一种通过组内和跨批次的相对偏好比较来更新融合策略的高效策略学习方法。此外,我们设计了任务关系感知融合模块,以显式建模不同目标之间的相互依赖性,从而实现上下文敏感的权重自适应。大量离线评估和在 Kuaishou 短视频搜索平台上的大规模在线 A/B 测试表明,SaFRO 显著优于最先进的基线方法,在短期排序质量和长期用户留存方面均实现了显著提升。
引用
@article{arxiv.2603.19584,
title = {PowerLens: Taming LLM Agents for Safe and Personalized Mobile Power Management},
author = {Xingyu Feng and Chang Sun and Yuzhu Wang and Zhangbing Zhou and Chengwen Luo and Zhuangzhuang Chen and Xiaomin Ouyang and Huanqi Yang},
journal= {arXiv preprint arXiv:2603.19584},
year = {2026}
}