中文

面向多传感器与多执行器智能体在可归类环境中的强化学习

人工智能 2011-07-04 v1

摘要

本文探讨了将强化学习应用于通过大量传感器感知环境并能利用众多执行器并行执行动作的智能体(如复杂自主机器人)所面临的问题。我们认为,只有对学习所处环境的特性做出强假设,以便能够轻易识别相关的传感器读数和运动指令,强化学习才能成功应用于此类情况。引入此类假设会导致学习系统带有强偏差,最终可能丧失传统强化学习算法的通用性。据此,我们观察到,在现实情境中,机器人获得的奖励仅依赖于所执行动作的一个缩减子集,且仅有传感器输入的一个缩减子集(在不同情境和每个动作中可能不同)与预测奖励相关。我们将这一性质形式化为所谓的“可归类性假设”,并提出了一种利用环境可归类性的算法,使得相较于现有强化学习算法能够缩短学习时间。我们报告了将该算法应用于两个模拟现实机器人问题(基于路标的导航和六足机器人步态生成)的结果,以验证我们的方法,并将其与现有的扁平化和基于泛化的强化学习方法进行比较。

关键词

引用

@article{arxiv.1107.0048,
  title  = {Reinforcement Learning for Agents with Many Sensors and Actuators Acting in Categorizable Environments},
  author = {E. Celaya and J. M. Porta},
  journal= {arXiv preprint arXiv:1107.0048},
  year   = {2011}
}