带延迟负面效应的强化学习中主动测量
机器学习
2025-10-17 v1 机器学习
摘要
在现实场景中,对强化学习(RL)中的状态进行测量可能昂贵且可能对未来结果产生负面影响。我们引入了主动可观测马尔可夫决策过程(AOMDP),在该过程中,智能体不仅选择控制动作,还决定是否对潜在状态进行测量。测量动作会揭示真实的潜在状态,但可能对环境产生负面延迟效应。我们表明,尽管存在此类成本,此类不确定性降低仍可可证地提高样本效率并增加最优策略的价值。我们将 AOMDP 表述为周期性部分可观测马尔可夫决策过程,提出基于信念状态的在线 RL 算法。为近似信念状态,我们进一步提出了顺序蒙特卡洛方法,以联合近似未知静态环境参数和未观测潜在状态的后验分布。我们在数字健康应用中对所提出算法进行评估,在该应用中,智能体决定何时提供数字干预以及何时通过调查来评估用户的健康状况。
引用
@article{arxiv.2510.14315,
title = {Active Measuring in Reinforcement Learning With Delayed Negative Effects},
author = {Daiqi Gao and Ziping Xu and Aseel Rawashdeh and Predrag Klasnja and Susan A. Murphy},
journal= {arXiv preprint arXiv:2510.14315},
year = {2025}
}