中文

黑暗中的寻求:基于潜在空间的测试时实例级策略梯度推理

机器学习 2026-01-21 v3 人工智能 计算与语言

摘要

推理能力作为人类智能的核心组件,至今仍是大型语言模型(LLM)实现通用人工智能(AGI)时的重大挑战。尽管模型性能在训练规模定律下提升,但针对训练算法的挑战仍存突出,尤其是灾难性遗忘和新训练数据的稀缺性。作为替代方案,测试时扩展通过增加测试时计算量(无需参数更新)提升推理性能。不同于此范式中先前方法聚焦于 token 空间,我们提出利用潜在空间实现更有效的推理并更好地遵循测试时扩展定律。我们引入LatentSeek框架,通过潜在空间中的测试时实例级适应(Test-Time Instance-level Adaptation, TTIA)增强 LLM 推理能力。具体而言,LatentSeek 利用策略梯度迭代更新潜在表示,由自生成奖励信号引导。LatentSeek 在GSM8K、MATH-500 和 AIME2024 等推理基准测试上进行评估,跨多种 LLM 架构。结果表明,LatentSeek 持续优于强基线方法,如链路思考提示和微调方法。进一步分析显示,LatentSeek 高效且典型在平均复杂度问题中仅需数次迭代即可收敛,同时受益于额外迭代,凸显了潜在空间测试时扩展的潜力。这些发现将LatentSeek定位为轻量、可扩展且高效的 LLM 推理能力提升方案。

关键词

引用

@article{arxiv.2505.13308,
  title  = {Seek in the Dark: Reasoning via Test-Time Instance-Level Policy Gradient in Latent Space},
  author = {Hengli Li and Chenxi Li and Tong Wu and Xuekai Zhu and Yuxuan Wang and Zhaoxin Yu and Eric Hanchen Jiang and Song-Chun Zhu and Zixia Jia and Ying Nian Wu and Zilong Zheng},
  journal= {arXiv preprint arXiv:2505.13308},
  year   = {2026}
}