中文

通过多域行为克隆实现跨域策略迁移:基于表示对齐

机器学习 2024-07-25 v1

摘要

将已学习技能在不同情境下迁移仍是自主智能体的根本挑战,尤其是在智能体无法与确切目标环境交互时。虽然先前方法主要聚焦于学习域转换,但往往难以处理显著的域差异或超出分布的任务。在本文中,我们提出了一种简单方法,用于跨域策略迁移,通过在多个域之间学习共享的潜在表示,并在其上构建通用的抽象策略。该方法利用多域行为克隆在非对齐的代理任务轨迹上进行,并采用最大均值差异 (MMD) 作为正则化项以鼓励跨域对齐。MMD 正则化比常用的域判别分布匹配更好地保留了潜在状态分布的结构,从而实现更高的迁移性能。此外,我们的方法只需训练一个多域策略,这使得扩展相对于现有方法更加容易。实验评估表明,我们的方法在各种域偏移场景中有效,尤其是在难以实现确切域转换的场景下,如跨形态或跨视角设置。我们的消融研究进一步表明,多域行为克隆在域对抗性正则化之外也隐式地为表示对齐贡献。

关键词

引用

@article{arxiv.2407.16912,
  title  = {Cross-Domain Policy Transfer by Representation Alignment via Multi-Domain Behavioral Cloning},
  author = {Hayato Watahiki and Ryo Iwase and Ryosuke Unno and Yoshimasa Tsuruoka},
  journal= {arXiv preprint arXiv:2407.16912},
  year   = {2024}
}

备注

CoLLAs 2024 (Oral). Code: https://github.com/hwatahiki/portable-latent-policy