中文

$\phi$-Decoding:用于平衡推理时探索与利用的自适应前瞻采样

机器学习 2025-03-18 v1 人工智能 计算与语言

摘要

推理时优化通过扩展计算量推导出审慎的推理步骤,以实现有效性能。尽管先前基于搜索的策略解决了自回归生成的短视问题,但庞大的搜索空间会导致过度探索与利用不足。为了在推导最优步骤时取得高效平衡,我们将解码策略构建为前瞻采样,利用模拟的未来步骤获取全局最优的步骤估计。在此基础上,我们提出了一种名为 ϕ\phi-Decoding 的新型解码策略。为了提供精确且富有表现力的步骤价值估计,ϕ\phi-Decoding 通过前瞻与聚类近似了两个分布。从联合分布中采样,可以选择最优步骤进行利用。为支持自适应计算分配,我们提出了宽度内与深度内剪枝策略,以轻量级解决方案实现推理效率。在七个基准上的广泛实验表明,ϕ\phi-Decoding 在性能和效率上均优于强基线。补充分析证明了其在各种 LLM 上的泛化能力以及在不同计算预算下的可扩展性。代码将发布于 https://github.com/xufangzhi/phi-Decoding,开源 PyPI 包即将推出。

关键词

引用

@article{arxiv.2503.13288,
  title  = {$\phi$-Decoding: Adaptive Foresight Sampling for Balanced Inference-Time Exploration and Exploitation},
  author = {Fangzhi Xu and Hang Yan and Chang Ma and Haiteng Zhao and Jun Liu and Qika Lin and Zhiyong Wu},
  journal= {arXiv preprint arXiv:2503.13288},
  year   = {2025}
}

备注

13 pages, 6 figures