中文

通过在演示数据集中搜索实现零样本模仿策略

人工智能 2024-04-09 v1

摘要

行为克隆利用演示数据集来学习策略。为了克服计算昂贵的训练过程并解决策略适应问题,我们提议使用预训练基础模型的潜在空间来索引演示数据集,即时访问相似的相關经验,并从这些情境中复制行为。智能体可以执行从选定的相似情境中得出的动作,直到智能体当前情境的表示与所选经验在潜在空间中发生分歧。因此,我们将控制问题表述为在专家演示数据集上的动态搜索问题。我们在 Video Pre-Training 模型的潜在表示中,于 BASALT MineRL 数据集上测试了我们的方法。我们将我们的模型与最先进的基于模仿学习的 Minecraft 智能体进行了比较。我们的方法可以有效地恢复有意义的演示,并在各种场景中展示 Minecraft 环境中智能体的类人行为。实验结果表明,我们的基于搜索的方法在准确性和感知评估方面明显优于基于学习的模型。

关键词

引用

@article{arxiv.2401.16398,
  title  = {Zero-shot Imitation Policy via Search in Demonstration Dataset},
  author = {Federco Malato and Florian Leopold and Andrew Melnik and Ville Hautamaki},
  journal= {arXiv preprint arXiv:2401.16398},
  year   = {2024}
}