中文

无数据增强视觉强化学习的零样本迁移

机器学习 2025-08-13 v2 人工智能 计算机视觉与模式识别 机器人学

摘要

将视觉强化学习(RL)代理推广至新环境仍是一项困难且开放的挑战。当前趋势是收集大规模数据集或使用数据增强技术以防止过拟合并提高下游泛化性能。然而,这些方法会随着任务变体数量的增加而呈指数级增长计算和数据收集成本,并可能 destabilize 训练 RL 代理的既难任务。本文借鉴近期计算神经科学的进展,提出一种名为 Associative Latent DisentAnglement(ALDA)的模型,基于标准的 off-policy RL 实现零样本泛化。具体而言,我们重新审视了潜在解缠在 RL 中的作用,展示了如何将其与关联记忆模型相结合,以实现无需依赖数据增强即可在困难任务变体上实现零样本泛化。最后,我们形式化地表明,数据增强技术是一种弱解缠方法,并讨论了这一洞见的含义。

关键词

引用

@article{arxiv.2410.07441,
  title  = {Zero-Shot Generalization of Vision-Based RL Without Data Augmentation},
  author = {Sumeet Batra and Gaurav S. Sukhatme},
  journal= {arXiv preprint arXiv:2410.07441},
  year   = {2025}
}

备注

Published at ICML 2025