中文

基于多臂老虎机的动态推测解码

交易与市场微观结构 2025-11-05 v1 计算机科学与博弈论 多智能体系统 系统与控制 系统与控制

摘要

推测解码通过使用轻量级草稿模型对 token 进行自回归生成,然后与更大型的目标模型并行验证,以加速 LLM。然而,确定要草拟多少个 token 仍是限制该方法有效性的关键挑战。动态推测解码旨在智能地决定草拟多少个 token 以实现最大加速。现有方法常常依赖于手工调谐、敏感的阈值(如 token 熵),这些阈值设置成本高昂且在不同模型和领域间难以泛化。我们提出 TapOut,一种基于多臂老虎机的在线、无需训练、即插即用的动态推测策略选择算法。我们的办法采用一种 meta 算法,从过去的奖励和探索中在多个无参数动态推测策略之间进行选择。我们在广泛的模型对和数据集上进行大量实验,表明 TapOut 在没有任何超参数调谋的情况下,能够实现与众所周知的动态推测基准相当或更好的加速速度。

关键词

引用

@article{arxiv.2511.02016,
  title  = {ABIDES-MARL: A Multi-Agent Reinforcement Learning Environment for Endogenous Price Formation and Execution in a Limit Order Book},
  author = {Patrick Cheridito and Jean-Loup Dupret and Zhexin Wu},
  journal= {arXiv preprint arXiv:2511.02016},
  year   = {2025}
}