遗传几何元强化学习:通过任务对称性实现非局部泛化
机器学习
2026-03-03 v1 人工智能
系统与控制
系统与控制
最优化与控制
摘要
元强化学习(Meta-RL)通常通过任务编码的光滑性来实现泛化。虽然这使对每个训练任务的局部泛化成为可能,但需要对任务空间进行密集覆盖,并未充分利用更丰富的任务空间结构。为此,我们发展了一种几何视角,为任务空间赋予“遗传几何”,由底层系统固有对称性诱导。具体而言,智能体通过对状态和动作进行李群的变换来复用在训练时期获得的策略。这将元强化学习转换为对称性发现,而非光滑外推,使智能体能够泛化到任务空间的更大区域。我们表明,当任务空间源自底层系统的对称性时,任务空间嵌入到那些可线性化、联通且紧凑的对称性子群中——这些属性使测试时的高效学习和推断成为可能。为学习这些结构,我们 developed a微分对称性发现方法。这会压缩函数不变约束,从而在功能方法上提高数值稳定性和样本效率。实证上,在二维导航任务中,我们的方法有效地恢复了真实对称性,并在整个任务空间内实现泛化,而常见的基线仅在训练任务附近实现泛化。
引用
@article{arxiv.2603.00396,
title = {Hereditary Geometric Meta-RL: Nonlocal Generalization via Task Symmetries},
author = {Paul Nitschke and Shahriar Talebi},
journal= {arXiv preprint arXiv:2603.00396},
year = {2026}
}
备注
Accepted to 2026 American Control Conference