中文

GCNT:基于图变换器的 morphology-agnostic 强化学习策略

机器人学 2025-05-22 v1

摘要

训练适用于不同形态的机器人的通用控制器是值得研究的趋势,因为它可以显著提高机器人系统的鲁棒性和恢复力。然而,不同形态的机器人会产生不同的状态空间和动作空间维度,使得传统策略网络难以适用。现有方法通过模块化机器人配置来解决此问题,却未充分提取和利用整体形态信息,而这已被证明是训练通用控制器的关键。为此,我们提出 GCNT,一种基于改进图卷积网络(GCN)和变换器的 morphology-agnostic 策略网络。它利用 GCN 和变换器能够处理任意模块数的特性,实现对 diverse 形态的兼容性。我们的关键见解是,GCN 能够高效提取机器人的形态信息,而变换器确保充分利用这些信息,使每个机器人节点能够直接通信这些信息。实验结果表明,我们的方法能够为配置不同的机器人生成鲁棒的运动行为,包括对训练期未见过的机器人形态的零样本泛化。特别是,GCNT 在 2 个标准基准测试中的 8 个任务上实现了最佳性能。

关键词

引用

@article{arxiv.2505.15211,
  title  = {GCNT: Graph-Based Transformer Policies for Morphology-Agnostic Reinforcement Learning},
  author = {Yingbo Luo and Meibao Yao and Xueming Xiao},
  journal= {arXiv preprint arXiv:2505.15211},
  year   = {2025}
}