中文

学习动态属性因子化世界模型以实现高效多对象强化学习

机器学习 2023-07-19 v1

摘要

在许多强化学习任务中,智能体须学会与多种类型的许多对象交互,并泛化到未见过的对象组合与数量。通常一个任务是先前所学任务的组合(例如积木堆叠)。这些是可组合泛化的例子,其中我们组合以对象为中心的表示来解决复杂任务。近期工作已展示了在这些设定中,对象因子化表示与层次化抽象对提升样本效率的益处。另一方面,这些方法未充分利用基于对象属性的因子化优势。本文中,我们抓住这一机会,引入了动态属性因子化强化学习(DAFT-RL)框架。在 DAFT-RL 中,我们利用以对象为中心的表示学习从视觉输入中提取对象。我们学习将对象分类并推断其潜在参数。对每一类对象,我们学习一个类模板图,描述该类对象的动力学与奖励如何依据其属性进行因子化。我们还学习一个交互模式图,描述不同类的对象在属性层面如何相互作用。通过这些图以及一个建模对象间交互的动态交互图,我们可以学习一个策略,该策略随后只需估计交互与潜在参数便可直接应用于新环境。我们在三个基准数据集上评估 DAFT-RL,结果表明我们的框架在泛化到具有变化属性与潜在参数的未见对象,以及已学任务的组合方面优于当前最优方法。

关键词

引用

@article{arxiv.2307.09205,
  title  = {Learning Dynamic Attribute-factored World Models for Efficient Multi-object Reinforcement Learning},
  author = {Fan Feng and Sara Magliacane},
  journal= {arXiv preprint arXiv:2307.09205},
  year   = {2023}
}