基于强化学习优化小红书搜索中的生成式排序相关性
信息检索
2025-12-30 v2 人工智能
摘要
排序相关性是搜索引擎的基本任务,旨在识别与给定用户查询最相关的条目。传统相关性模型通常产生标量得分或直接预测相关性标签,这限制了可解释性以及对复杂相关性信号的建模。灵感来自链式思考(Chain-of-Thought, CoT)为复杂任务的最新进展,我们探讨显式推理是否能提升可解释性和性能。然而,现有基于推理的生成式相关性模型(GRMs)主要依赖大量人工标注或合成 CoT 数据进行监督微调,往往导致泛化能力有限。此外,领域中性、自由形式的推理往往过于笼统且不足以扎实,限制了其处理开放域搜索中常见的多样且模糊情形的潜力。本文将小红书搜索中的相关性建模 formulation 为推理任务,引入基于强化学习(RL)的训练框架以提升 GRMs 的扎实推理能力。具体而言,我们将实际的业务相关性准则纳入多步骤推理提示设计,并提出 Stepwise Advantage Masking(SAM),一种轻量级过程监督策略,通过改进信用分配促进这些准则的有效学习。为实现工业部署,我们进一步将大规模 RL 调优模型蒸馏为轻量级版本,适用于实际搜索系统。广泛的离线评估和在线 A/B 测试表明,我们的方法在关键相关性和业务指标上均实现显著提升,验证了其在大规模工业搜索系统中有效、稳健且实用的特性。
引用
@article{arxiv.2512.00968,
title = {Optimizing Generative Ranking Relevance via Reinforcement Learning in Xiaohongshu Search},
author = {Ziyang Zeng and Heming Jing and Jindong Chen and Xiangli Li and Hongyu Liu and Yixuan He and Zhengyu Li and Yige Sun and Zheyong Xie and Yuqing Yang and Shaosheng Cao and Jun Fan and Yi Wu and Yao Hu},
journal= {arXiv preprint arXiv:2512.00968},
year = {2025}
}
备注
Accepted to the ADS Track at KDD 2026