中文

基于主动查询优化的移动健康干预算法优化

机器学习 2025-12-11 v1 机器学习

摘要

移动健康 (mHealth) 干预需要在干预有效性与用户负担之间进行权衡,尤其是在状态测量(例如用户调查或反馈)成本高昂却至关重要的情况下。Act-Then-Measure (ATM) 启发式方法通过在 Action-Contingently Noiselessly Observable Markov Decision Process (ACNO-MDP) 框架下将控制与测量动作解耦,来解决这一挑战。然而,标准 ATM 算法依赖基于时序差分的 Q 学习方法,在稀疏且噪声较大的环境中容易不稳定。本文提出了 ATM 的一种贝叶斯扩展,取代标准 Q 学习,采用卡尔曼滤波式贝叶斯更新,保持对 Q 值的不确定性感知估计,从而实现更稳定和样本高效的学习。我们在小型环境和临床导向的测试环境中对该方法进行评估。在小型离散环境中,贝叶斯 ATM 在显著降低方差和实现更稳定策略行为的同时,实现了与或优于标准 ATM 相当的标量化回报。相比,在更大更复杂的 mHealth 场景中,标准和贝叶斯 ATM 变体均表现不佳,这表明 ATM 的建模假设与真实世界 mHealth 领域的结构性挑战之间存在不匹配。这些发现凸显了在低数据环境中利用不确定性感知方法的价值,同时也强调了需要新的强化学习算法来显式建模因果结构、连续状态和受观察成本约束下的延迟反馈。

关键词

引用

@article{arxiv.2512.08950,
  title  = {Optimizing Algorithms for Mobile Health Interventions with Active Querying Optimization},
  author = {Aseel Rawashdeh},
  journal= {arXiv preprint arXiv:2512.08950},
  year   = {2025}
}