中文

通过推理与蒸馏学习用户兴趣:用于跨域新闻推荐

计算与语言 2026-02-17 v1 信息检索

摘要

新闻推荐在在线新闻平台中发挥着关键作用,帮助用户发现相关内容。跨域新闻推荐进一步需要从超出直接新闻消费的异构信号中推断用户的潜在信息需求。关键挑战在于超越表面级行为,捕捉更深层、可复用的用户兴趣,同时保持大规模生产系统的可扩展性。本文提出了一个强化学习框架,训练大型语言模型从跨域用户信号生成高质量的兴趣驱动新闻搜索查询列表。我们将查询列表生成形式化为策略优化问题,并采用 GRPO 结合多个奖励信号。我们系统研究了两个计算维度:推理时采样和模型容量,实证观察到随计算增加呈现出类似扩展行为的持续改进。最后,我们进行在策略蒸馏,将从大型计算密集型教师模型学习到的策略转移到适用于可扩展部署的紧凑学生模型。大量离线实验、消融研究以及在生产新闻推荐系统中的大规模在线 A/B 测试均显示,在兴趣建模质量和下游推荐性能方面均实现了一致的提升。

关键词

引用

@article{arxiv.2602.15005,
  title  = {Learning User Interests via Reasoning and Distillation for Cross-Domain News Recommendation},
  author = {Mengdan Zhu and Yufan Zhao and Tao Di and Yulan Yan and Liang Zhao},
  journal= {arXiv preprint arXiv:2602.15005},
  year   = {2026}
}