面向概念驱动的离策略评估
机器学习
2024-12-02 v1 人工智能
机器学习
摘要
使用批处理数据进行离策略决策评估面临显著挑战,由于样本量有限导致方差较大。为提高离策略评估 (OPE) 的效果,我们必须识别并解决导致方差的来源。最近的概念瓶颈模型 (CBM) 研究表明,使用人类可解释概念可改进预测并提供更好的理解。我们提出将概念纳入 OPE 以降低方差。本工作引入一族基于概念的 OPE 估计器,证明这些估计器在概念已知且预定义时保持无偏且可降低方差。由于实际应用常缺乏预定义概念,我们进一步开发了一种端到端算法,以学习可解释、简洁且多样化的参数化概念,以优化降低方差。我们的实验在合成数据和真实数据集上表明,无论是已知概念还是学习到的概念都显著改善了 OPE 性能。关键的是,我们表明,与其他 OPE 方法不同,基于概念的估计器易于解释,并可针对特定概念进行有针对性的干预,从而进一步提升这些估计器的质量。
引用
@article{arxiv.2411.19395,
title = {Concept-driven Off Policy Evaluation},
author = {Ritam Majumdar and Jack Teversham and Sonali Parbhoo},
journal= {arXiv preprint arXiv:2411.19395},
year = {2024}
}
备注
37 pages, 10 figures