ManiLong-Shot:面向长时程操控的交互感知式单次模仿学习
机器人学
2025-12-19 v1
摘要
单次模仿学习(OSIL)为机器人在大规模数据收集限制下学习新技能提供了可行路径。然而,现有 OSIL 方法主要局限于短时程任务,限制了其在复杂长时程操控中的适用性。为此,我们提出了 ManiLong-Shot—a 新型框架,使其能够有效地应用于长时程预示性操控任务。ManiLong-Shot 将长时程任务围绕物理交互事件进行结构化,将问题重新表述为对交互感知原语的序列化,而非直接模仿连续轨迹。该原语分解可由视觉-语言模型(VLM)的高层推理驱动,亦可由机器人状态变化派生的基于规则的启发式方法驱动。对于每个原语,ManiLong-Shot 预测操控中至关重要的不变区域,建立演示与当前观测之间的对应关系,并计算目标末端执行器姿态,从而实现有效的任务执行。大量仿真实验表明,仅基于 10 项短时程任务训练的 ManiLong-Shot 能通过单次模仿泛化至 20 项未见长时程任务(分为三个难度等级),实现约 22.8% 的相对提升。此外,实机机器人实验验证了 ManiLong-Shot 能通过 OSIL 稳健地执行三项长时程操控任务,确认了其实际应用价值。
引用
@article{arxiv.2512.16302,
title = {ManiLong-Shot: Interaction-Aware One-Shot Imitation Learning for Long-Horizon Manipulation},
author = {Zixuan Chen and Chongkai Gao and Lin Shao and Jieqi Shi and Jing Huo and Yang Gao},
journal= {arXiv preprint arXiv:2512.16302},
year = {2025}
}
备注
Accepted by AAAI 2026