基于值引导数据过滤的跨域策略适配
机器学习
2023-10-16 v2
摘要
在具有动态差异的不同域间泛化策略是强化学习中的一大挑战。例如,机器人在模拟器中学习策略,但当部署到真实世界时,环境的动态可能不同。给定具有动态差异的源域和目标域,我们考虑在线动态适配问题,此时智能体可获取充足的源域数据,而与目标域的在线交互有限。现有研究试图从动态差异的角度解决该问题。在本工作中,我们揭示了这些方法的局限性,并通过关于跨域值一致性的新洞见从值差异角度探索该问题。具体而言,我们提出值引导数据过滤(VGDF)算法,其基于成对值目标在两域间的接近程度有选择地共享源域的转移样本。在具有运动学和行为形态偏移的多种环境上的实证结果表明,我们的方法相比先前方法取得了更优性能。
引用
@article{arxiv.2305.17625,
title = {Cross-Domain Policy Adaptation via Value-Guided Data Filtering},
author = {Kang Xu and Chenjia Bai and Xiaoteng Ma and Dong Wang and Bin Zhao and Zhen Wang and Xuelong Li and Wei Li},
journal= {arXiv preprint arXiv:2305.17625},
year = {2023}
}
备注
27 pages, 15 figures