使用一种新表示模型的行为模式识别
机器学习
2013-03-22 v4
摘要
我们将逆强化学习 (IRL) 作为一种工具进行研究,用于在观察智能体与环境交互的序贯决策行为的基础上识别其行为。我们将智能体所面临的问题建模为马尔可夫决策过程 (MDP),并将观察到的智能体行为建模为针对该 MDP 的前向规划。我们使用 IRL 学习奖励函数,然后将这些奖励函数作为聚类或分类模型的基础。在 GridWorld(一个导航问题)和秘书问题(一个最优停止问题)上进行的实验研究表明,由 IRL 得到的奖励向量可以作为行为模式识别问题的良好基础。将我们的方法与几种现有的 IRL 算法以及使用状态-动作空间中观察到的特征统计量的直接方法进行经验比较,表明该方法在识别问题上可能更具优势。
引用
@article{arxiv.1301.3630,
title = {Behavior Pattern Recognition using A New Representation Model},
author = {Qifeng Qiao and Peter A. Beling},
journal= {arXiv preprint arXiv:1301.3630},
year = {2013}
}