基于布金姆的 Pi 定理实现强化学习中的零样本策略迁移
机器学习
2025-10-13 v1 机器人学
摘要
强化学习(RL)策略往往难以泛化到具有不同物理参数的新机器人、任务或环境,这一挑战限制了其实际应用。本文提出一种基于布金姆的 Pi 定理的简单零样本迁移方法,以解决这一限制。该方法通过对观察(inputs)和动作(outputs)进行尺度变换,适应新的系统上下文,无需重新训练。该方法在三个不断增加复杂性的环境中进行评估:模拟摆动、物理摆动用于仿真到现实的验证,以及高维HalfCheetah。结果表明,缩放后的迁移在动态相似的上下文中表现出无性能损失。此外,在非相似的上下文中,缩放后的策略持续优于朴素迁移,显著扩大了原始策略有效性的上下文范围。这些发现表明,尺度分析为增强RL策略的鲁棒性和泛化性提供了强大且实用的工具。
引用
@article{arxiv.2510.08768,
title = {Zero-Shot Policy Transfer in Reinforcement Learning using Buckingham's Pi Theorem},
author = {Francisco Pascoa and Ian Lalonde and Alexandre Girard},
journal= {arXiv preprint arXiv:2510.08768},
year = {2025}
}