动作分词器在上下文模仿学习中的重要性
机器人学
2026-01-08 v3
摘要
上下文模仿学习 (ICIL) 是一种新范式,使机器人能够从演示中泛化到未见任务而无需重新训练。良好的动作表示是有效捕获演示信息的关键,然而动作分词器(将动作离散化并编码的过程)在 ICIL 中仍 largely 未被探索。在这项工作中,我们首先系统地评估了 ICIL 中现有的动作分词器方法,并揭示了一个关键局限:虽然它们能有效编码动作轨迹,但未能保持时间平滑性,而这对稳定的机器人执行至关重要。为解决这一问题,我们提出了 LipVQ-VAE,一种通过权重归一化在潜在动作空间中强制利普希茨条件的变分自编码器。通过将平滑性约束从原始动作输入传播到量化潜在码本,LipVQ-VAE 生成更稳定、更平滑的动作。当集成到 ICIL 中时,LipVQ-VAE 在高保真模拟器中提升了超过 5.3% 的性能,真实世界实验也证实了其生成更平滑、更可靠轨迹的能力。代码和检查点可在 https://action-tokenizer-matters.github.io/ 获取。
引用
@article{arxiv.2503.01206,
title = {Action Tokenizer Matters in In-Context Imitation Learning},
author = {An Dinh Vuong and Minh Nhat Vu and Dong An and Ian Reid},
journal= {arXiv preprint arXiv:2503.01206},
year = {2026}
}
备注
IROS 2025