中文

基于语义对齐的强化学习表示映射用于零样图拼接

机器学习 2025-03-05 v1 人工智能

摘要

深度强化学习(RL)模型在环境观察或任务要求发生即使小变化时往往难以泛化。通常需要高昂的 retraining 才能应对这些变化,限制了已学习策略的可重用性。为此,本文基于近期语义对齐工作,提出一种零样图方法,用于映射不同智能体在不同视觉和任务变体下的潜在空间。具体而言,我们学习一种转换,将一个智能体编码器的嵌入映射到另一个智能体编码器的嵌入,无需进一步微调。我们的做法依赖一小组“锚”观察,这些观察在语义上对齐,我们利用它们估计仿射或正交变换。一旦找到该转换,现有的控制器即可在零样图方式下解释来自不同(现有)编码器的嵌入,跳过额外训练。我们经验性地证明了该框架在视觉和任务域迁移下保持高性能。我们在 CarRacing 环境中进行了零样图拼接实验,环境背景和任务均发生变化。通过允许模块化重组现有策略,为在动态变化环境中构建更稳健、可组合的强化学习铺平了道路。

关键词

引用

@article{arxiv.2503.01881,
  title  = {Mapping representations in Reinforcement Learning via Semantic Alignment for Zero-Shot Stitching},
  author = {Antonio Pio Ricciardi and Valentino Maiorca and Luca Moschella and Riccardo Marin and Emanuele Rodolà},
  journal= {arXiv preprint arXiv:2503.01881},
  year   = {2025}
}

备注

11 pages, 3 figures, 2 tables