LEPO:面向大语言模型的潜在推理策略优化
机器学习
2026-05-12 v3 人工智能
摘要
最近,潜在推理被引入大语言模型(LLM),以利用连续空间中的丰富信息。然而,缺乏随机抽样,这些方法不可避免地会退化为确定性推理,无法发现多样化的推理路径。为弥合这一差距,我们通过Gumbel-Softmax注入可控随机性,以恢复LLM的探索能力并提高其与强化学习(RL)的兼容性。基于此,我们提出潜在推理策略优化(LEPO),一种直接应用于连续潜在表示的RL新框架。具体而言,在 rollout 阶段,LEPO保持随机性以启用多样化轨迹抽样;在优化阶段,LEPO构建用于离散标记和潜在表示的统一梯度估计。广泛实验表明,LEPO显著优于现有用于离散推理和潜在推理的RL方法。
关键词
引用
@article{arxiv.2604.17892,
title = {LEPO: Latent Reasoning Policy Optimization for Large Language Models},
author = {Yuyan Zhou and Jiarui Yu and Hande Dong and Zhezheng Hao and Hong Wang and Jianqing Zhang and Qiang Lin},
journal= {arXiv preprint arXiv:2604.17892},
year = {2026}
}