中文

多目标环境中从教学式演示中进行语用学习

机器学习 2023-09-28 v3

摘要

从演示中学习的方法通常利用接近最优的演示来加速训练。相比之下,人类教师在演示任务时会偏离最优演示,并通过给出最能消除其所要演示目标歧义的演示来教学式地调整自身行为。类似地,人类学习者擅长语用地推断教师的意图,从而促进两个智能体之间的交流。这些机制在少量演示情形下至关重要,因为此时推断目标更为困难。在本文中,我们通过利用演示目标推断的贝叶斯模型(BGI)来实现教学与语用机制。我们在多目标教师-学习者设置中突出了该模型的优势,其中两个人工智能体使用目标条件强化学习进行学习。我们表明,结合BGI智能体(一个教学式教师和一个语用式学习者)相比标准从演示中学习能够实现更快的学习并降低目标歧义,尤其在少量演示情形下。我们提供了实验代码(https://github.com/Caselles/NeurIPS22-demonstrations-pedagogy-pragmatism)以及解释我们方法的说明视频(https://youtu.be/V4n16IjkNyw)。

关键词

引用

@article{arxiv.2206.04546,
  title  = {Pragmatically Learning from Pedagogical Demonstrations in Multi-Goal Environments},
  author = {Hugo Caselles-Dupré and Olivier Sigaud and Mohamed Chetouani},
  journal= {arXiv preprint arXiv:2206.04546},
  year   = {2023}
}

备注

NeurIPS 2022