具有部分可观测连续非线性动力学的逆理性控制
人工智能
2019-08-14 v1 系统与控制
系统与控制
神经元与认知
摘要
连续控制与规划在机器人与机器学习中仍是重大挑战。神经科学提供了从实现高度成功控制器的动物大脑中学习的机会,但尚不清楚如何将动物行为与控制原理相联系。从外部观察者视角,动物未必总是最优行动,但可能仍是理性行动:我们假设动物依据其自身内部世界模型,选择具有最高期望未来主观价值的动作。因此,它们的动作源于求解一个不同于神经科学实验中对其评估的最优控制问题。基于该假设,我们提出一种新颖的基于模型的逆理性控制框架,学习能最佳解释其在以部分可观测马尔可夫决策过程(POMDP)描述的任务中动作的主体内部模型。该方法中,我们首先使用扩展卡尔曼滤波器表示信念空间、 actor-critic 框架中的神经网络优化策略、以及参数空间的简化基,学习对动力学与主观奖励的整个模型空间泛化的最优策略。随后我们计算使由主体感官观测与所选动作组成的实验可观测数据似然最大化的模型。我们提出的方法能够在有限数据所给理论误差界内恢复模拟主体的真实模型。我们将此方法应用于神经科学实验中当前使用的一项复杂自然主义任务以作说明。该方法为解释动物大脑中高度适应控制器的行为与神经动力学提供了基础。
引用
@article{arxiv.1908.04696,
title = {Inverse Rational Control with Partially Observable Continuous Nonlinear Dynamics},
author = {Saurabh Daptardar and Paul Schrater and Xaq Pitkow},
journal= {arXiv preprint arXiv:1908.04696},
year = {2019}
}
备注
8 pages plus references