逆上下文赌博机:学习行为随时间的演化
机器学习
2022-06-09 v3 机器学习
摘要
通过观察决策者的行为来理解其优先考量,对于决策过程(如医疗健康)中的透明性与问责制至关重要。尽管传统的策略学习方法几乎总假设行为具有平稳性,但这在现实中很难成立:医疗实践随着临床专业人员随时间不断微调其知识而持续演化。例如,随着多年来医学界对器官移植理解的进步,一个切题的问题是:实际的器官分配策略是如何演化的?为给出回答,我们需要一种能提供可解释决策表征、尤其捕捉智能体对非平稳世界认知、且以离线方式运行的策略学习方法。首先,我们用上下文赌博机(contextual bandits)建模决策者的演化行为,并形式化逆上下文赌博机(ICB)问题。其次,我们提出两种具体算法作为解决方案,学习智能体行为的参数与非参数表征。最后,利用肝移植的真实与模拟数据,我们阐明了方法的适用性与可解释性,并对其进行基准测试与准确性验证。
引用
@article{arxiv.2107.06317,
title = {Inverse Contextual Bandits: Learning How Behavior Evolves over Time},
author = {Alihan Hüyük and Daniel Jarrett and Mihaela van der Schaar},
journal= {arXiv preprint arXiv:2107.06317},
year = {2022}
}
备注
In Proceedings of the 39th International Conference on Machine Learning