基于流动性的few-shot模仿学习中对人类演示的泛化
机器人学
2026-03-02 v2 机器学习
摘要
模仿学习(Imitation Learning, IL)通过演示让机器人无需显式任务建模即可学习复杂技能,但通常需要大量演示,造成显著的采集成本。先前的工作探索了使用流动性(flow)作为中间表征,以便使用人类视频取代机器人演示,从而减少所需演示的数量。然而,大多数先前工作仅关注流动性本身,无论是针对物体还是机器人/手部的特定点,无法描述交互运动。此外,仅依赖流动性实现对仅在人类视频中观察到的情景的泛化仍受限,因为流动性本身无法捕捉精确的运动细节。此外,依赖场景观测生成精确动作可能导致流动性条件化策略在训练任务上过拟合,削弱了流动性所暗示的泛化能力。为此,我们提出SFCrP,包括用于跨本体学习的场景流动性预测模型(SFCr)和基于流动性与裁剪点云条件化的策略模型(FCrP)。SFCr从机器人和人类视频中学习,并预测任意点轨迹。FCrP遵循整体流动性运动,根据观测调整动作以完成精确任务。我们的方法在各种真实世界任务设置下均优于SOTA基线,同时对仅在人类视频中看到的情景展现出强大的空间和实例泛化能力。
引用
@article{arxiv.2602.10594,
title = {Flow-Enabled Generalization to Human Demonstrations in Few-Shot Imitation Learning},
author = {Runze Tang and Penny Sweetser},
journal= {arXiv preprint arXiv:2602.10594},
year = {2026}
}
备注
Accepted to ICRA 2026