Vintix: 通过基于情境的强化学习实现动作模型
机器学习
2025-09-30 v2 人工智能
机器人学
摘要
基于情境的强化学习(In-Context Reinforcement Learning, ICRL)是一种具有前景的范式,旨在通过试错交互在推理时开发通用智能体,类似于大语言模型的情境适应,但侧重于奖励最大化。然而,ICRL 超出玩具任务和单一领域设置的可扩展性仍是未开放的挑战。本文介绍了首批步骤:引入一个固定的、跨域的模型,能够通过基于情境的强化学习学习行为。我们的结果表明,算法蒸馏(Algorithm Distillation)是一个为 ICRL 提供 compelling 且具竞争力的替代方案,相较于专家蒸馏,用于构建多功能动作模型。这些发现凸显了 ICRL 作为通用决策系统可扩展方法的潜力。代码已发布于 https://github.com/dunnolab/vintix
引用
@article{arxiv.2501.19400,
title = {Vintix: Action Model via In-Context Reinforcement Learning},
author = {Andrey Polubarov and Nikita Lyubaykin and Alexander Derevyagin and Ilya Zisman and Denis Tarasov and Alexander Nikulin and Vladislav Kurenkov},
journal= {arXiv preprint arXiv:2501.19400},
year = {2025}
}
备注
ICML 2025, Poster