中文

通过强化学习实现高保真异构来源文本用户表示

信息检索 2026-02-10 v1 人工智能 计算与语言 机器学习

摘要

有效地对大规模职业平台的用户进行建模需要基于包括个人资料、专业数据和搜索活动日志在内的异构文本来源。随着推荐系统越来越多地采用大型语言模型(LLM),从异构来源创建统一、可解释且简洁的用户表示变得至关重要,尤其是对于延迟敏感的在线环境。在本工作中,我们提出了一种新颖的强化学习(RL)框架,用于为每个成员合成统一的文本表示。该方法利用隐式用户参与信号(如点击、申请)作为主要奖励,以提炼关键信息。此外,该框架还辅以基于规则的奖励,以强制执行格式和长度约束。在多个 LinkedIn 产品上的大规模离线实验结果表明,显著改进了关键下游业务指标。该工作提供了一种实用、无标签且可扩展的用户表示构建方案,能够直接与 LLM-based 系统兼容。

关键词

引用

@article{arxiv.2602.07333,
  title  = {High Fidelity Textual User Representation over Heterogeneous Sources via Reinforcement Learning},
  author = {Rajat Arora and Ye Tao and Jianqiang Shen and Ping Liu and Muchen Wu and Qianqi Shen and Benjamin Le and Fedor Borisyuk and Jingwei Wu and Wenjing Zhang},
  journal= {arXiv preprint arXiv:2602.07333},
  year   = {2026}
}