中文

SHE:面向电商搜索相关性的分步混合检验强化学习框架

人工智能 2026-04-14 v3

摘要

查询-产品相关性预测是 AI 驱动的电商领域的关键,但当前基于大语言模型的方法面临困境:SFT 和 DPO 在因监督信号粗糙而难以实现长尾泛化,传统 RLVR 则因反馈稀疏无法纠正中间推理错误。我们提出分步混合检验(SHE),一种强化学习框架,通过分步奖励策略优化(SRPO)确保逻辑一致性。SRPO 利用混合奖励机制——结合生成式奖励模型与人工标注验证器——提供细粒度的步骤级信号。为进一步提升稳定性,SHE 包含多样化的数据过滤以维持策略熵谱,并引入多阶段课程学习协议以实现渐进技能获取。在真实世界搜索基准上的大量实验表明,SHE 在大规模电商环境中显著提升了推理质量和相关性预测准确度,超越 SFT、DPO、GRPO 等各类基线,同时增强了可解释性和鲁棒性。

关键词

引用

@article{arxiv.2510.07972,
  title  = {SHE: Stepwise Hybrid Examination Reinforcement Learning Framework for E-commerce Search Relevance},
  author = {Pengkun Jiao and Yiming Jin and Jianhui Yang and Chenhe Dong and Zerui Huang and Shaowei Yao and Xiaojiang Zhou and Dan Ou and Haihong Tang},
  journal= {arXiv preprint arXiv:2510.07972},
  year   = {2026}
}