基于离线强化学习与逆强化学习的扩散政策:用于穿戴式传感器中老年人体力活动促进
机器学习
2025-09-24 v1
摘要
利用来自临床数据的离线强化学习(RL)正日益受到AI医疗领域的关注。然而,其实际应用面临诸多挑战。直接定义奖励函数困难,逆RL(IRL)在复杂环境中难以从专家行为中推断出准确的奖励函数。离线RL也面临在医疗保健应用中将所学政策与观察到的人类行为对齐的挑战。为解决将离线RL应用于老年人(高跌倒风险)体力活动促进中所面临的挑战,基于穿戴式传感器活动监控,我们引入Kolmogorov-Arnold网络(KANDI)和扩散政策,用于离线逆强化学习。通过Kolmogorov-Arnold网络的灵活函数逼近,我们通过学习来自低跌倒风险老年人(专家)的自由活动环境行为,来估计奖励函数;而在演员-批评家框架中使用的扩散政策则提供了一种行动细化和效率提升的生成方法。我们使用来自我们Physio-feedback Exercise Program(PEER)研究中两个臂临床试验的数据评估了KANDI,强调其在跌倒风险干预项目中促进老年人体力活动的实际应用。此外,KANDI在D4RL基准上超越了当前最先进的方法。这些结果凸显了KANDI在医疗保健领域离线RL中的潜力,为活动促进干预策略提供了有效解决方案。
引用
@article{arxiv.2509.18433,
title = {Diffusion Policies with Offline and Inverse Reinforcement Learning for Promoting Physical Activity in Older Adults Using Wearable Sensors},
author = {Chang Liu and Ladda Thiamwong and Yanjie Fu and Rui Xie},
journal= {arXiv preprint arXiv:2509.18433},
year = {2025}
}
备注
Accepted at ICMLA 2025. 8 pages, 6 figures