动作分块中的视野混合
机器人学
2025-11-25 v1 人工智能
计算机视觉与模式识别
摘要
视觉-语言-动作(VLA)模型在机器人操作中展现了显著能力,但其性能对训练期间使用的动作块长度(称为视野)敏感。我们的实证研究揭示了一个固有的权衡:更长的视野提供更强的全局前瞻性但会降低细粒度精度,而更短的视野则锐化局部控制但在长期任务上表现不佳,这意味着固定选择单一视野是次优的。为了缓解这一权衡,我们提出了视野混合策略。MoH 将动作块重排为具有不同视野的几个段,以共享的动作变换器并行处理它们,并通过轻量线性门融合输出。它有三个吸引人的优点。1)MoH 在单个模型中联合利用长期前瞻性和短期精确性,改善了性能和泛化到复杂任务的能力。2)MoH 对于全注意力动作模块是即插即用的,训练或推理开销极小。3)MoH 支持通过跨视野共识选择稳定动作的自适应推理,实现比基线高 2.5 倍的吞吐量,同时保持优越的性能。在基于流的策略 π₀、π₀.₅ 和一步回归策略 π_reg 上的大量实验表明,MoH 在模拟和真实任务上均产生了持续且显著的提升。特别地,在混合任务设置下,带有 MoH 的 π₀.₅ 在仅 30k 次训练迭代后在 LIBERO 上达到了 99% 的平均成功率的新最先进水平。项目页面:https://github.com/Timsty1/MixtureOfHorizons
引用
@article{arxiv.2511.19433,
title = {Mixture of Horizons in Action Chunking},
author = {Dong Jing and Gang Wang and Jiaqi Liu and Weiliang Tang and Zelong Sun and Yunchao Yao and Zhenyu Wei and Yunhui Liu and Zhiwu Lu and Mingyu Ding},
journal= {arXiv preprint arXiv:2511.19433},
year = {2025}
}
备注
15 pages, 14 figures