基于 LSTM 中预期奖励的深度强化学习用于移动机器人碰撞避免
人工智能
2025-08-12 v1
摘要
本文提出了一种基于智能体位置短期预测的碰撞风险预期方法。一个基于过去轨迹训练的长短期记忆(LSTM)模型被用于估计每个机器人的下一个位置。该预测使我们能够通过动态调制深度 Q 学习网络(DQN)智能体的奖励来定义预期碰撞风险。该方法在一个受限环境中进行了测试,其中两个机器人在没有通信或标识符的情况下移动。尽管采样频率有限(1 Hz),但结果显示碰撞次数显著减少,稳定性得到改善。所提出的方法计算成本低,对于在嵌入式系统上的实现尤其具有吸引力。
引用
@article{arxiv.2508.07941,
title = {Deep Reinforcement Learning with anticipatory reward in LSTM for Collision Avoidance of Mobile Robots},
author = {Olivier Poulet and Frédéric Guinand and François Guérin},
journal= {arXiv preprint arXiv:2508.07941},
year = {2025}
}