中文

OmniSAT:紧凑动作令牌,更快的自回归

计算机视觉与模式识别 2025-10-14 v1 机器人学

摘要

现有的视觉-语言-动作(VLA)模型大致可分为基于扩散的方法和自回归(AR)方法:扩散模型捕捉连续动作分布,但依赖于计算量大的迭代去噪。相比之下,AR模型能够实现高效优化和灵活的序列构建,使其更适合大规模预训练。为了进一步提高AR效率,特别是当动作块产生扩展的高维序列时,先前的工作应用了熵引导和令牌频率技术来缩短序列长度。然而,这种压缩在“重建质量差或压缩效率低”方面存在困难。受此启发,我们引入了一种全向快速动作分词器(Omni Swift Action Tokenizer),它学习一种紧凑、可迁移的动作表示。具体来说,我们首先对值范围和时间范围进行归一化,以获得具有B样条编码的一致表示。然后,我们对位置、旋转和夹持器子空间应用多级残差量化,为每个部分生成具有从粗到细粒度的压缩离散令牌。在大规模数据集Droid上进行预训练后,得到的离散令牌化将训练序列缩短了6.8倍,并降低了目标熵。为了进一步探索OmniSAT的潜力,我们开发了一种跨具身学习策略,该策略建立在统一动作模式空间之上,并联合利用机器人和人类演示。它能够从异构的自我中心视频中实现可扩展的辅助监督。在多样化的真实机器人和模拟实验中,OmniSAT在保持重建质量的同时实现了更高的压缩率,从而实现了更快的AR训练收敛和模型性能。

关键词

引用

@article{arxiv.2510.09667,
  title  = {OmniSAT: Compact Action Token, Faster Auto Regression},
  author = {Huaihai Lyu and Chaofan Chen and Senwei Xie and Pengwei Wang and Xiansheng Chen and Shanghang Zhang and Changsheng Xu},
  journal= {arXiv preprint arXiv:2510.09667},
  year   = {2025}
}