基于切换奖励和历史依赖的逆向强化学习:用于表征动物行为
机器学习
2025-07-16 v3 人工智能
摘要
传统方法侧重于简化的行为任务,其中动物执行重复、刻板的动作以获得明确的奖励。虽然这些方法有助于我们了解决策,但将我们的理解限制在由明确目标驱动的短时间尺度行为中。在自然环境中,动物表现出更复杂的、长期的行为,这些行为由难以观察的内在动机驱动。最近的时变逆向强化学习(IRL)工作旨在捕捉长期自由行为中变化的动机。然而,一个关键挑战仍然存在:动物的决策基于其历史,而不仅仅是当前状态。为此,我们提出SWIRL(切换IRL),一种扩展传统IRL的新框架,纳入时变、历史依赖奖励函数。SWIRL将长行为序列建模为短期决策过程之间的转换,每个过程都由独特的奖励函数支配。SWIRL纳入了生物学上合理的历史依赖,以捕捉过去决策和环境背景如何塑造行为,为更准确地描述动物决策提供了可能。我们将SWIRL应用于模拟和真实世界的动物行为数据集,表明它在缺乏历史依赖性的模型中,既在定量上也在定性上均表现更佳。这项工作首次将历史依赖的策略和奖励纳入IRL模型,以推动我们对复杂、自然行为决策的理解。
引用
@article{arxiv.2501.12633,
title = {Inverse Reinforcement Learning with Switching Rewards and History Dependency for Characterizing Animal Behaviors},
author = {Jingyang Ke and Feiyang Wu and Jiyi Wang and Jeffrey Markowitz and Anqi Wu},
journal= {arXiv preprint arXiv:2501.12633},
year = {2025}
}