标记思维:通过强化学习解锁个性化推理
计算与语言
2025-09-30 v1
摘要
最近的进展赋予了大语言模型(LLM)令人印象深刻的通用推理能力,但它们通常在个性化推理方面遇到困难——即分析用户历史、推断独特偏好并生成定制化回答的关键能力。为解决这一局限性,我们引入了TagPR,一个通过标记思维方法显著增强LLM个性化推理内在能力的新训练框架。我们的方法首先开发了一个数据驱动的流水线来自动生成和语义标记推理链,创建了一个促进可解释推理的结构化数据集。然后我们提出了一种协同训练策略,从基于标记数据的监督微调(SFT)开始以建立基础推理模式,随后进行多阶段强化学习(RL)过程。该RL阶段由一个独特的复合奖励信号引导,该信号整合了基于标签的约束和一个新颖的带用户嵌入的个性化奖励模型(PRMU),以实现与用户特定逻辑的细粒度对齐。在公共LaMP基准和自构建数据集上的广泛实验表明,我们的方法取得了最先进的结果,在所有任务上相对于基础模型实现了平均32.65%的提升。我们的工作验证了结构化、可解释的推理是释放LLM中真正个性化能力的高度有效途径。
引用
@article{arxiv.2509.23140,
title = {Tagging the Thought: Unlocking Personalization Reasoning via Reinforcement Learning},
author = {Song Jin and Juntian Zhang and Yong Liu and Xun Zhang and Yufei Zhang and Fei Jiang and Guojun Yin and Wei Lin and Rui Yan},
journal= {arXiv preprint arXiv:2509.23140},
year = {2025}
}