基于物理信息深度生成模型的强化学习在太空飞行应用中的数据稀缺问题缓解
机器学习
2026-05-12 v2
摘要
基于强化学习(RL)的控制器在物理系统上的部署常因难以泛化到真实场景而受限,这被称为仿真到现实(sim-to-real)差距。这种差距在太空飞行领域尤为具有挑战性,因为由于高成本和有限的行星探索数据,真实世界的训练数据稀缺。传统方法,如系统辨识和合成数据生成,依赖于充足的数据,常因建模假设或缺乏物理约束而失败。我们提出通过在生成模型中引入物理学习偏置来解决数据稀缺问题。具体而言,我们开发了基于互信息的分割变分自编码器(MI-VAE),这是一种受物理约束的VAE模型,它学习观测系统轨迹与由基于物理的模型预测的轨迹之间的差异。MI-VAE的潜在空间能够生成遵循物理约束的合成数据集。我们在行星着陆问题上评估了MI-VAE,关注有限的真实数据和离线RL训练。结果表明,利用MI-VAE生成的样本丰富化数据集显著提高了下游RL性能,在统计保真度、样本多样性和策略成功率方面均优于标准VAE。本工作表明,这是一种可扩展的策略,能够提高复杂数据受限环境中自主控制器的鲁棒性。
引用
@article{arxiv.2604.02438,
title = {Mitigating Data Scarcity in Spaceflight Applications for Offline Reinforcement Learning Using Physics-Informed Deep Generative Models},
author = {Alex E. Ballentine and Nachiket U. Bapat and Raghvendra V. Cowlagi},
journal= {arXiv preprint arXiv:2604.02438},
year = {2026}
}