中文

面向少样本策略迁移的在线原型对齐

机器学习 2023-06-14 v1 人工智能

摘要

强化学习(RL)中的域适应主要处理将策略迁移到新环境时观测的变化。许多传统的 RL 域适应方法试图以显式或隐式方式学习源域与目标域之间的映射函数。然而,它们通常需要访问大量来自目标域的数据。此外,它们往往依赖视觉线索来学习映射函数,当源域与目标域外观差异较大时可能失效。为解决这些问题,我们提出一种新颖的框架——在线原型对齐(OPA),基于元素的功能相似性来学习映射函数,并能够在仅数个回合内实现少样本策略迁移。OPA 的核心思想是引入一种探索机制,能够以高效且有目的的方式与目标域中未见过的元素交互,然后根据其功能(而非视觉线索)将其与源域中已见过的元素建立联系。实验结果表明,当目标域在视觉上与源域不同时,OPA 即使使用远少于目标域的样本也能取得更好的迁移性能,优于先前的方法。

关键词

引用

@article{arxiv.2306.07307,
  title  = {Online Prototype Alignment for Few-shot Policy Transfer},
  author = {Qi Yi and Rui Zhang and Shaohui Peng and Jiaming Guo and Yunkai Gao and Kaizhao Yuan and Ruizhi Chen and Siming Lan and Xing Hu and Zidong Du and Xishan Zhang and Qi Guo and Yunji Chen},
  journal= {arXiv preprint arXiv:2306.07307},
  year   = {2023}
}

备注

This paper has been accepted at ICML2023