面向密集环境安全探索的图注意力平台无关强化学习框架
机器人学
2025-11-20 v1
摘要
自动探索充满障碍物的空间需要确保效率的同时保证安全,以避免与障碍物发生碰撞。本文研究了一种新型平台无关强化学习框架,将基于图神经网络的策略用于下一路标点选择,集成安全过滤器以确保安全移动。具体而言,神经网络通过近端策略优化(PPO)算法进行训练,以最大化探索效率,同时最小化安全过滤器的干预。因此, 当策略提议不可行的动作时,安全过滤器会用最近的可行替代方案覆盖它,以确保系统行为的一致性。此外,本文引入了由势场驱动的奖励函数,考虑代理人靠近未探索区域的距离以及从抵达这些区域获取的预期信息增益。该框架将强化学习基于探索策略的可适应性与显式安全机制提供的可靠性相结合。这一特征在于使基于学习的策略能够在真实环境中部署于机器人平台上。广泛的仿真和实验评估表明,该方法在密集空间中实现了高效且安全的探索。
引用
@article{arxiv.2511.15358,
title = {Platform-Agnostic Reinforcement Learning Framework for Safe Exploration of Cluttered Environments with Graph Attention},
author = {Gabriele Calzolari and Vidya Sumathy and Christoforos Kanellakis and George Nikolakopoulos},
journal= {arXiv preprint arXiv:2511.15358},
year = {2025}
}
备注
8 pages, 6 figures, submitted to the 2026 IEEE International Conference on Robotics & Automation