PageLLM:面向大语言模型的全页优化的多粒度奖励框架
机器学习
2026-05-26 v2 人工智能
摘要
全页优化(WPO)决定搜索和推荐结果如何呈现给用户,而大语言模型(LLMs)通过将页面生成视为序列生成为其开辟了新途径。然而,将LLMs适配到Web规模的WPO仍受限于对昂贵人工标注的需求以及页面级连贯性与项目级放置之间的粒度不匹配。在本工作中,我们证明这两个挑战是耦合的:只要奖励信号被解耦为两个互补的粒度,隐式用户反馈本身就足以实现对齐。我们提出了PageLLM,一个基于奖励的微调框架,(i)将隐式反馈转化为四个对比偏好对族,涵盖相关性、排序、多样性和冗余性,(ii)学习粗粒度页面级奖励和细粒度项目级奖励以捕捉参与度敏感的位置交换,以及(iii)在预训练LLM上通过基于PPO的RLHF结合两种奖励。在七个Amazon类别上对十一个基线的大规模实验表明,单独使用任何一种奖励都不够——丢弃页面级或项目级信号分别使NDCG@100降低17.8%和15.2%,而联合奖励将NDCG@100提升了高达46.8%。在1000万用户的在线A/B测试中部署后,PageLLM将GMV提升了0.44%,点击率提升了0.14%,证实了来自隐式反馈的多粒度奖励可扩展至生产级WPO。代码和数据在匿名仓库中可获取。
引用
@article{arxiv.2506.09084,
title = {PageLLM: A Multi-Grained Reward Framework for Whole-Page Optimization with Large Language Models},
author = {Xinyuan Wang and Liang Wu and Dongjie Wang and Yanjie Fu},
journal= {arXiv preprint arXiv:2506.09084},
year = {2026}
}