一种用于视图规划问题的强化学习方法
计算机视觉与模式识别
2016-11-21 v2
摘要
我们提出视图规划问题(VPP)的一种强化学习(RL)解决方案,该问题生成能够感知给定对象(表示为 3D 模型)所有可访问区域的视点序列。在此过程中,目标是最小化视点数量,使 VPP 成为一类集覆盖优化问题(SCOP)。SCOP 是 NP-hard 的,不可近似性结果表明贪婪算法提供了多项式时间内运行的最佳近似。为了找到优于贪婪算法的解决方案,(i)我们利用 3D 模型的几何形状引入一种新颖的评分函数,(ii)我们使用该评分函数对 VPP 的直观人类方法进行建模,(iii)我们将 VPP 视为马尔可夫决策过程(MDP),并在 RL 框架中使用众所周知的 RL 算法解决 MDP。特别地,我们使用 SARSA、Watkins-Q 和 TD 与函数近似来解决 MDP。我们在广泛的测试对象上将我们的方法与基线贪婪算法进行比较,并显示我们几乎在所有情况下都优于基线。
引用
@article{arxiv.1610.06204,
title = {A Reinforcement Learning Approach to the View Planning Problem},
author = {Mustafa Devrim Kaba and Mustafa Gokhan Uzunbas and Ser Nam Lim},
journal= {arXiv preprint arXiv:1610.06204},
year = {2016}
}