中文

使用强化学习和慢特征分析的机器人导航

人工智能 2012-05-07 v1 神经与进化计算

摘要

将强化学习算法应用于实际问题总是面临从原始传感器读数中过滤环境状态的挑战。虽然大多数方法使用启发式方法,但生物学表明必须存在一种无监督的方法来自动构建这样的过滤器。除了提取环境状态外,过滤器必须以支持现代强化算法的方式表示它们。许多流行算法使用线性架构,因此应该致力于与线性函数结合具有良好逼近特性的过滤器。本论文提出无监督方法慢特征分析(SFA)用于此任务。给定随机序列的传感器读数,SFA学习一组过滤器。随着模型复杂度和训练样本的增加,过滤器收敛于三角多项式函数。这些函数已知具有出色的逼近能力,因此应该很好地支持强化算法。我们在机器人上评估了这一主张。任务是使用最小二乘策略迭代(LSPI)算法在简单环境中学习导航控制。唯一可访问的传感器是头戴式摄像机,但如果没有有意义的过滤,视频图像不适合作为LSPI输入。我们将展示,基于机器人的随机行走视频,由SFA学习的过滤器允许学习到的控制在约80%的测试试验中成功导航。

关键词

引用

@article{arxiv.1205.0986,
  title  = {Robot Navigation using Reinforcement Learning and Slow Feature Analysis},
  author = {Wendelin Böhmer},
  journal= {arXiv preprint arXiv:1205.0986},
  year   = {2012}
}

备注

Diploma Thesis