展示,而非告知:从示范中学习奖励机器以用于基于强化学习的心脏起搏器合成
机器学习
2024-11-05 v1 信号处理
摘要
(人工)心脏起搏器是一种植入式电子设备,通过向心脏发送电脉冲来调节心跳。随着起搏器使用者的数量持续上升,对具有额外传感器、适应性和改进电池性能的功能的需求也在增长。强化学习(RL)最近被提出作为心脏起搏器创造性设计空间探索、适应和统计验证的高效算法。在此过程中,设计以奖励机形式表示的正确奖励函数是一项关键的编程活动。2007年,波士顿科学公司发表了其起搏器规格的详细描述。这份文件此后成为使用实时自动机和逻辑对起搏器规格进行形式化表征的基础。然而,由于这些转换是手动完成的,因此难以验证。此外,在自动机或逻辑中捕获需求也众所周知是困难的。我们认为,对于电生理学家等领域专家来说,观察和识别与患者-起搏器相互作用相对应的心电图异常要容易得多。因此,我们探索了从此类标记示范中学习正确规范(以奖励机形式)并训练RL智能体基于所得奖励机合成心脏起搏器的可能性。我们利用机器学习的进展,通过循环神经网络和Transformer架构从标记示范中提取信号作为奖励机。然后使用这些奖励机设计一个简单的起搏器,并采用RL。最后,我们使用波士顿科学公司文档中提取的属性验证了所得起搏器。
引用
@article{arxiv.2411.01750,
title = {Show, Don't Tell: Learning Reward Machines from Demonstrations for Reinforcement Learning-Based Cardiac Pacemaker Synthesis},
author = {John Komp and Dananjay Srinivas and Maria Pacheco and Ashutosh Trivedi},
journal= {arXiv preprint arXiv:2411.01750},
year = {2024}
}
备注
8 pages, 3 page appendix