中文

基于正-未标记学习与记忆回放推断约束网络

机器学习 2025-01-17 v3 人工智能 机器人学

摘要

规划广泛的真实任务需要了解并编写所有约束。但是,存在约束未知或难以准确指定的实例。可能的解决方案是从专家演示中推断未知约束。大多数先前工作限制 themselves 学习简单线性约束,或需要对真实约束参数化或环境模型的强知识。为缓解这些问题,本文提出一种正-未标记(PU)学习方法,从演示中推断连续的、任意的且可能非线性的约束。从 PU 学习的角度,我们将演示中的所有数据视为正(可行)数据,并学习一个(次)优策略以生成高回报但可能不可行的轨迹,作为包含可行和不可行状态的未标记数据。在数据分布的假设下,通过后处理 PU 学习技术,从这两个数据集中学习可行-不可行分类器(即约束模型)。该方法采用交替更新策略:更新生成并筛选更高回报策略的策略,以及更新约束模型。此外,引入记忆缓冲区来记录和重用前一次迭代中的样本,以防止遗忘。在两个 MuJoCo 环境中验证了所提方法的有效性,成功推断连续非线性约束,并在约束准确性和策略安全性方面优于基线方法。

关键词

引用

@article{arxiv.2407.16485,
  title  = {Learning Constraint Network from Demonstrations via Positive-Unlabeled Learning with Memory Replay},
  author = {Baiyu Peng and Aude Billard},
  journal= {arXiv preprint arXiv:2407.16485},
  year   = {2025}
}