基于正-未标记学习与记忆回放推断约束网络
机器学习
2025-01-17 v3 人工智能
机器人学
摘要
规划广泛的真实任务需要了解并编写所有约束。但是,存在约束未知或难以准确指定的实例。可能的解决方案是从专家演示中推断未知约束。大多数先前工作限制 themselves 学习简单线性约束,或需要对真实约束参数化或环境模型的强知识。为缓解这些问题,本文提出一种正-未标记(PU)学习方法,从演示中推断连续的、任意的且可能非线性的约束。从 PU 学习的角度,我们将演示中的所有数据视为正(可行)数据,并学习一个(次)优策略以生成高回报但可能不可行的轨迹,作为包含可行和不可行状态的未标记数据。在数据分布的假设下,通过后处理 PU 学习技术,从这两个数据集中学习可行-不可行分类器(即约束模型)。该方法采用交替更新策略:更新生成并筛选更高回报策略的策略,以及更新约束模型。此外,引入记忆缓冲区来记录和重用前一次迭代中的样本,以防止遗忘。在两个 MuJoCo 环境中验证了所提方法的有效性,成功推断连续非线性约束,并在约束准确性和策略安全性方面优于基线方法。
引用
@article{arxiv.2407.16485,
title = {Learning Constraint Network from Demonstrations via Positive-Unlabeled Learning with Memory Replay},
author = {Baiyu Peng and Aude Billard},
journal= {arXiv preprint arXiv:2407.16485},
year = {2025}
}