增强机器人导航:单目标与多目标强化学习策略的评估
机器人学
2023-12-15 v2 机器学习
摘要
本研究对单目标和多目标强化学习方法进行了比较分析,旨在训练机器人有效导航至终点目标的同时高效避开障碍物。传统的强化学习技术,即 Deep Q-Network(DQN)、Deep Deterministic Policy Gradient(DDPG)和 Twin Delayed DDPG(TD3),在 Gazebo 仿真框架中于多种环境下进行了评估,这些环境具有随机目标和机器人起始位置等参数。这些方法为机器人提供数值奖励,以指示相对于目标的动作质量。然而,在存在多个潜在冲突目标的复杂环境中,它们的局限性变得明显。为了解决这些局限性,我们提出了一种采用多目标强化学习(MORL)的方法。通过修改奖励函数以返回一个奖励向量,其中每个元素对应一个不同的目标,机器人学习到一个能有效平衡不同目标的策略,旨在实现 Pareto 最优解。这项比较研究突显了 MORL 在复杂、动态机器人导航任务中的潜力,为未来研究更适应和更鲁棒的机器人行为奠定了基础。
引用
@article{arxiv.2312.07953,
title = {Enhancing Robotic Navigation: An Evaluation of Single and Multi-Objective Reinforcement Learning Strategies},
author = {Vicki Young and Jumman Hossain and Nirmalya Roy},
journal= {arXiv preprint arXiv:2312.07953},
year = {2023}
}
备注
REU program project (work in progress)