超越固定形态: 在可变动作空间中利用信任区域补偿学习图策略
机器学习
2025-08-21 v1 机器人学
系统与控制
系统与控制
摘要
信任区域基于优化方法已成为连续控制任务中提供稳定性和强大经验性能的基础 reinforcement learning 算法。对可扩展和可重用控制策略的日益关注也推动了对形态泛化需求的增长, 即控制策略应能应对不同的运动学结构。图基策略架构提供了一种自然且有效的机制来编码此类结构差异。然而, 尽管这些架构能够容纳可变形态, 但在动作空间维度变化的情况下, 信任区域方法的行为仍知之�少。为此, 我们对信任区域基于策略的优化方法进行了理论分析, 关注 Trust Region Policy Optimization (TRPO) 及其广泛使用的一阶近似方法 Proximal Policy Optimization (PPO)。目标是展示可变动作空间维度如何影响优化 landscape, 尤其是在由 KL 散度或策略裁剪惩罚所施加的约束下。补充理论见解之外, 我们在 Gymnasium Swimmer 环境中进行了实证评估, 在该环境中对运动学结构进行系统控制变更, 而不改变底层任务, 这使其特别适合研究形态泛化。
引用
@article{arxiv.2508.14102,
title = {Beyond Fixed Morphologies: Learning Graph Policies with Trust Region Compensation in Variable Action Spaces},
author = {Thomas Gallien},
journal= {arXiv preprint arXiv:2508.14102},
year = {2025}
}