中文

基于提示的视觉对齐用于零样本策略迁移

计算机视觉与模式识别 2024-06-06 v1 人工智能

摘要

强化学习(RL)中的过拟合已成为阻碍其在强化学习中应用的主要障碍之一。现有方法未对特征提取器提供明确的语义约束,阻碍了智能体学习统一的跨域表示,并导致在未见域上的性能下降。此外,还需要来自多个域的丰富数据。为了解决这些问题,在这项工作中,我们提出了基于提示的视觉对齐(PVA),一个鲁棒的框架,用于减轻图像中有害的域偏差,以实现零样本策略迁移。受视觉-语言模型(VLM)可以作为连接文本空间和图像空间的桥梁的启发,我们利用文本序列中包含的语义信息作为显式约束来训练视觉对齐器。因此,视觉对齐器可以将来自多个域的图像映射到一个统一的域,并实现良好的泛化性能。为了更好地描述语义信息,应用了提示调优来学习一系列可学习的标记。在语义信息的显式约束下,PVA可以在有限访问跨域数据的情况下学习统一的跨域表示,并在未见域中实现出色的零样本泛化能力。我们在基于视觉的自动驾驶任务上使用CARLA模拟器验证了PVA。实验表明,在有限访问多域数据的情况下,智能体在未见域上具有良好的泛化能力。

关键词

引用

@article{arxiv.2406.03250,
  title  = {Prompt-based Visual Alignment for Zero-shot Policy Transfer},
  author = {Haihan Gao and Rui Zhang and Qi Yi and Hantao Yao and Haochen Li and Jiaming Guo and Shaohui Peng and Yunkai Gao and QiCheng Wang and Xing Hu and Yuanbo Wen and Zihao Zhang and Zidong Du and Ling Li and Qi Guo and Yunji Chen},
  journal= {arXiv preprint arXiv:2406.03250},
  year   = {2024}
}

备注

This paper has been accepted by ICML2024