基于最优性的奖励学习及其在毒理学中的应用
统计方法学
2024-04-09 v1
摘要
在毒理学研究中,常常进行实验以确定毒素暴露对小鼠行为的影响,其中小鼠被随机分配是否接受毒素。特别是在固定间隔实验中,提供小鼠额外的奖励(如食物 pellet),以基于小鼠执行的某个动作(如按杠杆)来提供奖励,但奖励仅在固定时间间隔后提供。为了分析固定间隔实验,常规做法是指定并估计条件状态-动作分布(例如使用方差分析)。这种现有方法在强化学习框架中被称为建模小鼠的"行为策略",对模型指定不敏感。任何用于行为策略的模型都可能被指定错误;从小鼠的暴露到其动作的映射可能高度复杂。本文通过学习小鼠的奖励函数来避免指定行为策略。指定奖励函数与指定行为策略同样具有挑战性,但我们提出了一种新方法,融合了对最优行为的知识,这通常被实验者所知,以避免指定奖励函数本身。在本文中,我们将奖励定义为小鼠动作与最优性之间的偏离度,其中动作和最优性的表征可以是任意复杂的。奖励函数的参数随之成为小鼠对最优性偏离程度容忍度的度量,这是对暴露影响的一种新型概括。该参数是标量量,提出的目标函数是可微的,使我们能够从参数估计量的一致性常规结果中受益,同时对假设做出很少的要求。
引用
@article{arxiv.2404.04406,
title = {Optimality-based reward learning with applications to toxicology},
author = {Samuel J. Weisenthal and Matthew Eckard and Askhan Ertefaie and Marissa Sobolewski and Sally W. Thurston},
journal= {arXiv preprint arXiv:2404.04406},
year = {2024}
}
备注
28 pages, 4 figures