半监督跨域模仿学习
机器学习
2026-02-12 v1 机器人学
摘要
跨域模仿学习 (CDIL) 通过在不同域之间传递专家知识来加速策略学习,这在收集专家数据成本较高的应用中尤为珍贵。现有方法要么是监督式的,依赖代理任务和显式对齐,要么是无监督式的,对齐分布而不使用配对数据,但往往不稳定。我们提出半监督 CDIL (SS-CDIL) 设置,并提出首个具有理论依据的 SS-CDIL 方法。我们的算法仅使用离线数据,包括少量目标专家演示和一些未标记的不完美轨迹。为了处理域间差异,我们提出了一种新型跨域损失函数,用于学习域间状态-动作映射,并设计自适应权重函数以平衡源知识和目标知识。MuJoCo 和 Robosuite 上的实验表明,我们的方法在基准方法上 consistently 获得提升,表明我们的做法能够以最小监督实现稳定且数据高效的策略学习。我们的代码可在 https://github.com/NYCU-RL-Bandits-Lab/CDIL 查阅。
引用
@article{arxiv.2602.10793,
title = {Semi-Supervised Cross-Domain Imitation Learning},
author = {Li-Min Chu and Kai-Siang Ma and Ming-Hong Chen and Ping-Chun Hsieh},
journal= {arXiv preprint arXiv:2602.10793},
year = {2026}
}
备注
Published in Transactions on Machine Learning Research (TMLR)