高效外样本恢复的收缩动力学模仿策略
机器学习
2025-03-27 v2 机器人学
机器学习
摘要
模仿学习是一种从专家行为中学习策略的数据驱动方法,但在外样本(OOS)区域容易产生不可靠结果。虽然依赖稳定动力学系统的先前研究能保证收敛至目标状态,但常常忽视瞬态行为。我们提出一种框架,用于学习由收缩动力学系统建模的策略,确保所有策略滚动过程在任何扰动下都收敛,从而实现高效的 OOS 恢复。通过利用循环平衡网络和耦合层,策略结构保证任何参数选择下都满足收缩性,从而促进无约束优化。我们还提供了最坏情况和预期损失的理论上界,以严格建立我们方法在部署中的可靠性。经验上,我们在仿真机器人操作和导航任务上 demonstrate了显著的 OOS 性能提升。
引用
@article{arxiv.2412.07544,
title = {Contractive Dynamical Imitation Policies for Efficient Out-of-Sample Recovery},
author = {Amin Abyaneh and Mahrokh G. Boroujeni and Hsiu-Chin Lin and Giancarlo Ferrari-Trecate},
journal= {arXiv preprint arXiv:2412.07544},
year = {2025}
}
备注
International Conference on Learning Representations