CROSS-GAiT:基于交叉注意力的多模态表示融合用于复杂地形的参数化步态适应
机器人学
2025-07-22 v3
摘要
我们提出了 CROSS-GAiT,这是一种用于四足机器人的最新算法,通过交叉注意力机制融合来自视觉输入和时间序列输入(包括线性加速度、角速度和关节力矩)派生的terrain表示;这些融合后的表示用于持续调整两个关键步态参数(步高和髋部展开度),实现对不同地形条件的动态适应步态。为生成terrain表示,我们通过掩码Vision Transformer(ViT)编码器处理视觉输入,通过扩张因果卷积编码器处理时间序列数据。交叉注意力机制随后从每个模态中选择并整合最相关的特征,将terrain特征与机器人动力学结合,以实现 Informed 的步态适应。这种融合表示使 CROSS-GAiT 能够实时响应不可预测的地形条件持续调整步态参数。我们在包括沥青、混凝土、砖砌地面、草地、密集植被、卵石、碎石和沙地等多样化地形上训练 CROSS-GAiT,并在未出现的环境中验证其泛化能力。我们将硬件实现部署在 Ghost Robotics Vision 60 上,表现出在挑战性地形(如高密度植被、不稳定表面、沙滩和可变形基质)中的优异性能。我们观察到与基于最新方法相比,IMU 能量密度至少降低 7.04%,总关节力矩降低 27.3%,这直接与增加稳定性和降低能源消耗相关。此外,CROSS-GAiT 在四个复杂场景中成功率至少提高 64.5%,到达目标时间降低 4.91%。在地形分类任务上,所学表示比基于最新方法的性能提升 4.48%。
关键词
引用
@article{arxiv.2409.17262,
title = {CROSS-GAiT: Cross-Attention-Based Multimodal Representation Fusion for Parametric Gait Adaptation in Complex Terrains},
author = {Gershom Seneviratne and Kasun Weerakoon and Mohamed Elnoor and Vignesh Rajgopal and Harshavarthan Varatharajan and Mohamed Khalid M Jaffar and Jason Pusey and Dinesh Manocha},
journal= {arXiv preprint arXiv:2409.17262},
year = {2025}
}