中文

下一词预测与后悔最小化

机器学习 2026-03-31 v1 人工智能 计算机科学与博弈论

摘要

我们考察如何在对抗性在线决策环境中运用下一词预测算法。具体而言,如果我们在对手行动序列分布 D\mathcal{D} 上训练下一词预测模型,当情况下诱导的在线决策算法(通过对模型预测进行近似最佳响应)具有低对抗后悔(即 D\mathcal{D} 是否为\emph{低后悔分布})?对于无界上下文窗口(即模型的预测可以依赖对手迄今为止所采取的所有行动),我们证明尽管并非每个分布 D\mathcal{D} 都是低后悔分布,但每个分布 D\mathcal{D} 都与一个低后悔分布在 TV 距离上指数接近(在 TV 距离上),因此总能以几乎不损失原始下一词预测模型准确性的方式实现亚线性后悔。与此相反,对于有界上下文窗口(即模型的预测只能依赖对手过去 ww 次行动,如现代 transformer 架构中可能的情况),我们证明存在一些对手博弈的分布 D\mathcal{D} 这些分布与任何低后悔分布 D\mathcal{D'} 之间相距 Θ(1)\Theta(1)(即使 w=Ω(T)w = \Omega(T) 且此类分布存在)。最后,我们通过表明无界上下文鲁棒化程序可以实现于标准 transformer 架构的层次,提供实证证据表明 transformer 模型可以高效地训练来表示这些新的低后悔分布。

关键词

引用

@article{arxiv.2603.28499,
  title  = {Next-Token Prediction and Regret Minimization},
  author = {Mehryar Mohri and Clayton Sanford and Jon Schneider and Kiran Vodrahalli and Yifan Wu},
  journal= {arXiv preprint arXiv:2603.28499},
  year   = {2026}
}