Astra:面向 embodied instruction following 的高效Transformer架构与对比动力学学习
机器人学
2026-01-21 v2
摘要
视觉语言动作模型因其在具身指令跟随任务中处理多模态序列的能力而受到广泛关注。但大多数现有模型依赖因果注意力机制,我们发现不利于处理由来自不同模态的交错片段组成的序列。在本文中,我们引入Astra,一种新型Transformer架构,采用轨迹注意力和可学习动作查询,旨在高效处理分段多模态轨迹并预测imitation learning的动作。此外,我们提出一种对比动力学学习目标,以增强模型对环境动力学和多模态对齐的理解,补充主要的行为克隆目标。通过在三个大型机器人操作基准测试上的大量实验,Astra在先前模型之上实现了显著的性能提升。
引用
@article{arxiv.2408.01147,
title = {Astra: Efficient Transformer Architecture and Contrastive Dynamics Learning for Embodied Instruction Following},
author = {Yueen Ma and Dafeng Chi and Shiguang Wu and Yuecheng Liu and Yuzheng Zhuang and Irwin King},
journal= {arXiv preprint arXiv:2408.01147},
year = {2026}
}
备注
Accepted to EMNLP 2025 (main). Published version: https://aclanthology.org/2025.emnlp-main.688/ Code available at: https://github.com/yueen-ma/Astra