中文

我的机器人会实现我的目标吗?预测 MDP 策略达到用户指定行为目标的概率

机器学习 2024-04-04 v2 统计方法学 机器学习

摘要

当自主系统执行任务时,它应维持对其实现用户目标概率的校准估计。如果该概率降至某个期望水平以下,它应提醒用户以便采取适当的干预措施。本文考虑用户目标被指定为实值性能摘要(如在固定视界 HH 处测量的累积奖励)的目标区间的设置。在每个时间 t{0,,H1}t \in \{0, \ldots, H-1\},我们的方法生成对最终累积奖励将落在用户指定目标区间 [y,y+][y^-,y^+] 内概率的校准估计。使用此估计,如果概率降至指定阈值以下,自主系统可以发出警报。我们通过反转保形预测来计算概率估计。我们的出发点是 Romano 等人的保形分位数回归(Conformalized Quantile Regression, CQR)方法,该方法将分裂保形预测应用于分位数回归的结果。CQR 是不可逆的,但通过使用条件累积分布函数(CDF)作为非一致性度量,我们展示了如何获得一种可逆的修改,我们称之为概率空间保形分位数回归(Probability-space Conformalized Quantile Regression, PCQR)。与 CQR 一样,PCQR 产生具有有限样本边缘保证的校准良好的条件预测区间。通过反转 PCQR,我们获得了对自主系统累积奖励将低于从响应变量的边缘分布采样的阈值(即校准的 CDF 估计)的概率的保证,我们采用该分布来预测用户指定目标区间的覆盖概率。在两个领域的实验证实这些概率是校准良好的。

关键词

引用

@article{arxiv.2211.16462,
  title  = {Will My Robot Achieve My Goals? Predicting the Probability that an MDP Policy Reaches a User-Specified Behavior Target},
  author = {Alexander Guyer and Thomas G. Dietterich},
  journal= {arXiv preprint arXiv:2211.16462},
  year   = {2024}
}

备注

12 pages, 4 figures. Appears in Proceedings of AAAI FSS-22 Symposium "Lessons Learned for Autonomous Assessment of Machine Abilities (LLAAMA)" The original submission had an error in theorem 2. Moreover, the stated guarantees for PCQR^{-1} were incorrect. This revision states the correct guarantees and corresponding theorem