中文

基于无动作Transformer编码器-解码器的上下文表示:用于元强化学习

机器人学 2025-12-18 v2

摘要

强化学习(RL)使机器人能够在不确定的环境中运行,但标准方法往往在面对未见任务时表现差。上下文自适应元强化学习通过对任务表示进行条件化来解决这些限制,但大多数方法依赖于经验中完整的动作信息,使得任务推断与特定策略紧密耦合。本文提出Context Representation via Action Free Transformer encoder decoder(CRAFT),一种仅从状态和奖励序列推断任务表示的信念模型。通过消除对动作的依赖,CRAFT将任务推断从策略优化中解耦,支持模块化训练,并利用 amortize 变分推断实现可扩展的信念更新。基于带有旋转位置嵌入的Transformer编码器-解码器构建,模型捕获长程时间依赖关系,稳健地编码参数和非参数任务变体。在 MetaWorld ML-10 机器人操作基准测试中进行的实验表明,CRAFT 在适应速度、泛化能力和探索效率方面均优于上下文自适应元-RL基线。这些发现凸显了无动作推断作为可扩展机器人控制RL基础的潜力。

关键词

引用

@article{arxiv.2512.14057,
  title  = {Context Representation via Action-Free Transformer encoder-decoder for Meta Reinforcement Learning},
  author = {Amir M. Soufi Enayati and Homayoun Honari and Homayoun Najjaran},
  journal= {arXiv preprint arXiv:2512.14057},
  year   = {2025}
}