基于深度变分自编码器学习用于机器人导航的表示映射
机器人学
2018-09-18 v2 计算机视觉与模式识别
机器学习
摘要
本工作的目标是使用变分自编码器(VAE)学习室内环境的表示,该表示可用于机器人导航。我们使用从视频中提取的图像(相机在房屋内巡游拍摄)来训练具有4维潜空间的VAE模型。模型训练完成后,每一真实帧在潜空间流形上都有对应的表示点,而每个表示点都有对应的重建图像。对于导航问题,我们将起始图像和目的地图像映射到潜空间,然后在学到的流形上优化连接两点的路径,最后通过解码器将路径映射回图像序列。理想的图像序列应对应于空间上连续的路线——即路线中相邻图像应对应于物理空间中的相邻位置。这样的路线可用于基于计算机视觉技术的导航,即机器人可逐步跟随图像序列从起始位置到达环境中的目的地。我们实现了该算法,但在实验中发现所得路线并不令人满意。路线由理想路线上若干不连续的帧组成,因此实际上无法被采用计算机视觉技术的机器人跟随。在我们的评估中,提出了自动寻找连续路线失败的两个原因:(1)VAE倾向于捕捉全局结构,但丢弃细节;(2)用于度量房屋图像间连续性的欧氏相似性度量是次优的。对于进一步工作,我们建议:尝试其他生成模型如VAE-GANs,其可能在重建细节以学习表示映射方面表现更好,并调整路径选择算法中的相似性度量。
引用
@article{arxiv.1807.02401,
title = {Learning a Representation Map for Robot Navigation using Deep Variational Autoencoder},
author = {Kaixin Hu and Peter O'Connor},
journal= {arXiv preprint arXiv:1807.02401},
year = {2018}
}