中文

目标条件自回归模型中的不一致性

机器学习 2026-04-02 v2 人工智能

摘要

我们从数学角度研究了不一致性的概念:这是一种结构性问题,源于对自回归模型进行草率的目标条件化所得的强化学习策略。在我们关注的过程中是关于在模型对自身动作进行再训练,即使用在线 RL 对离线学习的策略进行微调。我们证明了它会降低不一致性并导致回报的提高,并旨在表征随之而来的策略轨迹。通过重新表述控制-推断和软 Q 学习的标准概念,我们在两种其他理解迭代再训练过程的方式之间建立了三方对应关系:一种是将后验折叠到奖励中,另一种是在确定性情况下则是降低温度参数;该对应关系通过训练-推断权衡具有计算内容。通过软条件化生成模型,我们讨论了不一致性与有效时域之间的关系。

关键词

引用

@article{arxiv.2510.06545,
  title  = {Incoherence in Goal-Conditioned Autoregressive Models},
  author = {Jacek Karwowski and Raymond Douglas},
  journal= {arXiv preprint arXiv:2510.06545},
  year   = {2026}
}

备注

To appear in the Proceedings of the 29th International Conference on Artificial Intelligence and Statistics (AISTATS) 2026