鞅前瞻采样:一种有原则的推理时大语言模型解码方法
机器学习
2026-01-23 v1 人工智能
摘要
大语言模型(LLM)中标准的自回归解码本质上缺乏远见,由于其逐词生成过程,往往无法找到全局最优的推理路径。虽然推理时策略如前瞻采样试图通过模拟未来步骤来缓解这一问题,但它们通常依赖临时启发式方法来评估路径价值和修剪搜索空间。本文提出了鞅前瞻采样(MFS),一个有原则的框架,将 LLM 解码重新表述为识别最优随机过程的问题。通过将推理路径的质量建模为随机过程,我们利用鞅理论设计了一种具有理论基础的算法。我们的方法用概率论原理取代了启发式机制:步骤价值源自 Doob 分解定理以衡量路径的可预测优势,路径选择使用可选停止定理对次优候选进行原则性修剪,而基于鞅收敛定理的自适应停止规则在路径质量可证明收敛后终止探索。在六个推理基准上的实验表明,MFS 在准确率上超越了 SOTA 方法,同时显著提高了计算效率。代码将发布于 https://github.com/miraclehetech/EACL2026-Martingale-Foresight-Sampling。
引用
@article{arxiv.2601.15482,
title = {Martingale Foresight Sampling: A Principled Approach to Inference-Time LLM Decoding},
author = {Huayu Li and ZhengXiao He and Siyuan Tian and Jinghao Wen and Ao Li},
journal= {arXiv preprint arXiv:2601.15482},
year = {2026}
}