中文

状态时间表示用于增强强化学习中的泛化能力

机器学习 2024-11-12 v1 机器人学

摘要

在基于图像的强化学习中,建立鲁棒且可泛化的状态表示至关重要。近期基于度量学习的进展,如深度双模拟度量方法,已展示出从像素观测中学习结构化低维表示空间的前景,其中状态间的距离基于任务相关特征进行度量。然而,这些方法在要求泛化能力的任务和非信息性奖励场景中面临挑战。这是因为它们未能在所学表示中捕获足够的长期信息。为应对这些挑战,我们提出一种新颖的状态时间表示(State Chrono Representation, SCR)方法。SCR 通过在双模拟度量学习的更新步骤中融入广泛的时间信息来增强基于度量的状态表示。它在一个时间框架内学习状态距离,同时考虑未来动力学以及当前和长期未来状态的累积奖励。我们的学习策略有效地将未来行为信息融入表示空间,而无需引入大量额外参数来建模动力学。在 DeepMind Control 和 Meta-World 环境中进行的大量实验表明,SCR 在要求泛化能力的任务中相较于其他近期基于度量的方法取得了更好的性能。SCR 的代码可在 https://github.com/jianda-chen/SCR 获取。

关键词

引用

@article{arxiv.2411.06174,
  title  = {State Chrono Representation for Enhancing Generalization in Reinforcement Learning},
  author = {Jianda Chen and Wen Zheng Terence Ng and Zichen Chen and Sinno Jialin Pan and Tianwei Zhang},
  journal= {arXiv preprint arXiv:2411.06174},
  year   = {2024}
}