用于从专家演示推断非线性连续约束函数的正-未标记约束学习
机器人学
2025-01-17 v2 人工智能
机器学习
摘要
为 diverse real-world 机器人任务进行规划需要知道并编写所有约束。然而,存在约束未知或难以准确指定的情形。一种可能的解决方案是从专家演示中推断未知约束。本文提出了一种新型的两步正-未标记约束学习 (PUCL) 算法,用于从演示中推断连续约束函数,而无需对真实约束参数化或环境模型进行先验知识。我们将演示中所有数据视为正 (可行) 数据,并学习一种控制策略以生成可能不可行的轨迹,作为未标记数据。 proposed 的两步学习框架首先使用距离度量识别可靠的不可行数据,其次从可行演示和可靠不可行数据中学习二分类可行性分类器(即约束函数)。该方法能够学习复杂形状的约束边界,且不会像以前的方法那样将演示错误地分类为不可行。通过四个受约束环境中的网络策略或动力系统策略验证了所提方法的有效性。它成功地推断了连续非线性约束,并在约束精度和策略安全性方面优于其他基线方法。该工作已发表于 IEEE Robotics and Automation Letters (RA-L),请参阅 https://doi.org/10.1109/LRA.2024.3522756 获取最终版本。
引用
@article{arxiv.2408.01622,
title = {Positive-Unlabeled Constraint Learning for Inferring Nonlinear Continuous Constraints Functions from Expert Demonstrations},
author = {Baiyu Peng and Aude Billard},
journal= {arXiv preprint arXiv:2408.01622},
year = {2025}
}