面向智能体强化学习的潜在 Poincaré 调制
机器学习
2026-03-12 v3
摘要
我们提出 LaPha 方法,用于在 Poincaré 潜在空间中训练类 AlphaZero 的 LLM 智能体。在 LaPha 下,搜索过程可被视作以提示为根、从原点向 Poincaré 球的边界生长的树,其中负曲率在半径处提供指数级的容量提升。使用双曲线测地距离进行规则验证正确性,我们定义节点势能并通过势能差分配稠密过程奖励。我们进一步在相同的共享潜在空间上附加一个轻量级价值头,实现几乎无额外开销的自指导测试时扩展。在 MATH-500 上,LaPha 将 Qwen2.5-Math-1.5B 从 66.0% 提升至 88.2%。在价值头引导的搜索下,LaPha-1.5B 在 AIME'24 上达到 56.7% 的准确率,LaPha-7B 进一步在 AIME'24 上达到 60.0% 的准确率,在 AIME'25 上达到 53.3% 的准确率。
引用
@article{arxiv.2602.09375,
title = {Latent Poincar\'e Shaping for Agentic Reinforcement Learning},
author = {Hanchen Xia and Baoyou Chen and Zelin Zang and Yutang Ge and Guojiang Zhao and Siyu Zhu},
journal= {arXiv preprint arXiv:2602.09375},
year = {2026}
}