中文

Time After Time: 基于深度 Q 学习的干预时机与行动的最佳化估计

机器学习 2025-03-21 v1 人工智能

摘要

医疗、机器人和金融等领域的问题需要同时推断何时以及如何行动的价值。当前方法希望通过人工智能来估计诸如患者治疗方案或资源在时间上的配置效果。然而,现有方法在处理不规则时间上的干预效果估计时困难,或通过离散化时间处理,或完全忽略时机政策的影响。我们提出了新的深度 Q 算法,称为 Earliest Disagreement Q-Evaluation (EDQ),用于同时估计何时以及如何行动的效果。EDQ 利用 Q 函数的递归结构,能够与灵活的序列模型(如 Transformer)兼容。在标准假设下,EDQ 能够提供准确的估计。我们通过在生存时间和肿瘤生长任务上的实验验证了该方法。

关键词

引用

@article{arxiv.2503.15890,
  title  = {Time After Time: Deep-Q Effect Estimation for Interventions on When and What to do},
  author = {Yoav Wald and Mark Goldstein and Yonathan Efroni and Wouter A. C. van Amsterdam and Rajesh Ranganath},
  journal= {arXiv preprint arXiv:2503.15890},
  year   = {2025}
}