面向集体动物运动的贝叶斯逆强化学习
机器学习
2022-06-14 v3 机器学习
摘要
基于智能体的方法允许定义生成复杂群体行为的简单规则。此类模型的治理规则通常先验设定,参数根据观测行为轨迹调整。逆强化学习利用马尔可夫决策过程的性质,对治理长期行为策略的短期(局部)规则进行推断,而非对所有预期场景做简化假设。我们使用计算高效的线性可解马尔可夫决策过程,为自驱动粒子(SPP)模型模拟和圈养孔雀鱼种群的数据应用学习集体运动的局部规则。行为决策代价的估计在贝叶斯框架中通过基函数平滑完成。我们在SPP模拟中恢复了真实代价,并发现孔雀鱼更看重集体运动而非朝向庇护所的目标运动。
引用
@article{arxiv.2009.04003,
title = {Bayesian Inverse Reinforcement Learning for Collective Animal Movement},
author = {Toryn L. J. Schafer and Christopher K. Wikle and Mevin B. Hooten},
journal= {arXiv preprint arXiv:2009.04003},
year = {2022}
}