逆在线学习:理解非平稳与反应性策略
机器学习
2022-10-03 v2
摘要
众所周知,人类决策并不完美,在试图帮助或提升决策者执行任务的能力时(例如提醒其潜在的偏见或疏忽),单独分析此类过程至关重要。为此,有必要对智能体如何决策以及该过程如何随智能体基于累积经验在线学习并作出反应而随时间变化,建立可解释的表示。为了理解一组观测轨迹背后的决策过程,我们将策略推断问题视为该在线学习问题的逆问题。通过在潜在结果框架内解释动作,我们引入了一种基于智能体选择其认为具有最大处理效应的动作的有意义映射。我们提出了一种实用算法,利用构建于一类富有表现力的深度状态空间模型之上的新颖架构,回溯式估计此类感知效应及智能体更新它们的过程。通过应用于 UNOS 器官捐献接受决策的分析,我们证明了我们的方法能为支配决策过程及其随时间演变的因素带来有价值的洞察。
引用
@article{arxiv.2203.07338,
title = {Inverse Online Learning: Understanding Non-Stationary and Reactionary Policies},
author = {Alex J. Chan and Alicia Curth and Mihaela van der Schaar},
journal= {arXiv preprint arXiv:2203.07338},
year = {2022}
}