中文

面向概念驱动的离策略评估

机器学习 2024-12-02 v1 人工智能 机器学习

摘要

使用批处理数据进行离策略决策评估面临显著挑战,由于样本量有限导致方差较大。为提高离策略评估 (OPE) 的效果,我们必须识别并解决导致方差的来源。最近的概念瓶颈模型 (CBM) 研究表明,使用人类可解释概念可改进预测并提供更好的理解。我们提出将概念纳入 OPE 以降低方差。本工作引入一族基于概念的 OPE 估计器,证明这些估计器在概念已知且预定义时保持无偏且可降低方差。由于实际应用常缺乏预定义概念,我们进一步开发了一种端到端算法,以学习可解释、简洁且多样化的参数化概念,以优化降低方差。我们的实验在合成数据和真实数据集上表明,无论是已知概念还是学习到的概念都显著改善了 OPE 性能。关键的是,我们表明,与其他 OPE 方法不同,基于概念的估计器易于解释,并可针对特定概念进行有针对性的干预,从而进一步提升这些估计器的质量。

关键词

引用

@article{arxiv.2411.19395,
  title  = {Concept-driven Off Policy Evaluation},
  author = {Ritam Majumdar and Jack Teversham and Sonali Parbhoo},
  journal= {arXiv preprint arXiv:2411.19395},
  year   = {2024}
}

备注

37 pages, 10 figures