Vintix II:面向可扩展的基于决策预训练的 Transformer 在-context 强化学习
机器学习
2026-04-08 v1 人工智能
机器人学
摘要
最近的进展表明,基于 in-context 强化学习(ICRL)的代理程序具有潜力,可在推理阶段直接获取新任务。算法蒸馏(AD) pioneered 了这一范式,并随后扩展至多领域设置,但其对未见任务的泛化能力仍受限。决策预训练 Transformer(DPT)被引入作为一种替代方案,在简化域中展示了更强的 in-context 强化学习能力,但其可扩展性尚未得到验证。本文将 DPT 扩展至多样化的多域环境,采用 Flow Matching 作为自然的训练选择,以保持其作为贝叶斯后验抽样的解释。结果获得的代理程序在数百个 diverse 任务上进行训练,能够在 held-out 测试集上实现明显的泛化提升。该代理程序超越了之前的 AD 扩展,展示了在在线和离线推理中的更强性能,进一步证明了 ICRL 作为训练通用代理程序的专家蒸馏的可行替代方案。
引用
@article{arxiv.2604.05112,
title = {Vintix II: Decision Pre-Trained Transformer is a Scalable In-Context Reinforcement Learner},
author = {Andrei Polubarov and Lyubaykin Nikita and Alexander Derevyagin and Artyom Grishin and Igor Saprygin and Aleksandr Serkov and Mark Averchenko and Daniil Tikhonov and Maksim Zhdanov and Alexander Nikulin and Ilya Zisman and Albina Klepach and Alexey Zemtsov and Vladislav Kurenkov},
journal= {arXiv preprint arXiv:2604.05112},
year = {2026}
}
备注
ICLR 2026, Poster