中文

超通用策略近似:利用超网络从单张图像学习生成动作

机器学习 2022-07-11 v1

摘要

受 Gibson 关于人类视觉中物体可供性(affordance)概念的启发,我们提出如下问题:智能体如何仅通过一次瞥见,就学会为新颖物体或环境预测出完整的动作策略?为应对该问题,我们引入通用策略函数(UPF)的概念,其为状态到动作的映射,不仅可泛化至新目标,更重要的是可泛化至未见过的全新环境。具体而言,我们考虑在计算与通信能力受限(边缘设备中常遇到的约束)的智能体上高效学习此类策略的问题。我们提出超通用策略近似器(HUPA),一种基于超网络(hypernetwork)的模型,可从单张图像生成小型的、任务与环境条件化的策略网络,并具备良好的泛化特性。我们的结果表明,在生成大小受限的策略时,HUPA 显著优于基于嵌入的替代方法。尽管本工作仅限于简单的基于地图的导航任务,未来工作包括将 HUPA 背后的原理应用于学习物体与环境的更一般可供性。

关键词

引用

@article{arxiv.2207.03593,
  title  = {Hyper-Universal Policy Approximation: Learning to Generate Actions from a Single Image using Hypernets},
  author = {Dimitrios C. Gklezakos and Rishi Jha and Rajesh P. N. Rao},
  journal= {arXiv preprint arXiv:2207.03593},
  year   = {2022}
}