基于希尔伯特空间的强化学习用于可扩展的多机器人覆盖与探索
机器人学
2026-02-24 v1 人工智能
多智能体系统
摘要
我们提出了一种覆盖框架,将希尔伯特空间填充先验集成到去中心化的多机器人学习与执行中。将希尔伯特基于的空间指数增强DQN和PPO,以结构化探索并减少稀疏奖励环境中的冗余。我们进一步描述了一种路径点界面,将希尔伯特排序转换为曲率受限、时序参数化的SE(2)轨迹(平面(x, y, {theta})),实现资源受限机器人上的 onboard 可行性。实验表明,与DQN/PPO基线相比,覆盖效率、冗余性和收敛速度均得到改善。在Boston Dynamics Spot四足机器人上进行验证,在室内环境中执行生成的轨迹,观察到低冗余的可靠覆盖。这些结果表明,几何先验可提高集群和四足机器人人的自主性和可扩展性。
引用
@article{arxiv.2602.19400,
title = {Hilbert-Augmented Reinforcement Learning for Scalable Multi-Robot Coverage and Exploration},
author = {Tamil Selvan Gurunathan and Aryya Gangopadhyay},
journal= {arXiv preprint arXiv:2602.19400},
year = {2026}
}