基于Deep Koopman增强扩散策略的Imitation Learning置信鲁棒性提升
机器人学
2025-11-11 v1
摘要
将生成模型与动作块编排在仿真学习中显示出巨大的潜力。然而,现有的扩散方法往往难以捕捉跨多步骤的强时序依赖,尤其是在纳入本体感知输入后。这种限制可能导致任务失败,使策略过度依赖本体感知线索而牺牲从视觉中捕获的任务特征。为克服此挑战,我们提出Deep Koopman增强双分支扩散策略(D3P)算法。D3P引入双分支架构以解耦不同感知模态组合的作用。视觉分支编码视觉观测以指示任务进程,而融合分支整合视觉与本体感知输入以实现精确操作。在该架构下,当机器人未能完成中间目标(例如抓取抽屉把手)时,策略可动态切换至执行由视觉分支生成的动作块,从而回到先前观察到的状态并促进任务重试。为进一步提升视觉表征学习,我们采用Deep Koopman算子模块从视觉输入中捕捉结构化时序动态。在推断过程中,我们使用生成模型的测试时损失作为置信信号,以指导聚合具有时序重叠的预测动作块,从而增强策略执行的可靠性。在六个RLBench桌面操作任务的仿真实验中,D3P相较于领先的扩散策略平均提升了14.6%。在三个真实世界机器人操作任务中,实现了15.0%的改进。代码:https://github.com/dianyeHuang/D3P。
引用
@article{arxiv.2511.00555,
title = {Improving Robustness to Out-of-Distribution States in Imitation Learning via Deep Koopman-Boosted Diffusion Policy},
author = {Dianye Huang and Nassir Navab and Zhongliang Jiang},
journal= {arXiv preprint arXiv:2511.00555},
year = {2025}
}
备注
Accepted by IEEE T-RO