中文

反事实解释迭代式部分达成的收益与风险

机器学习 2023-06-20 v2 人工智能

摘要

反事实(CF)解释,亦称对比解释与算法补救,因在高风险领域解释机器学习模型而广受欢迎。对于收到负面模型预测(如房贷申请被拒)的主体,CF 解释是具正面预测的相似实例,告知主体改进之道。尽管其诸多性质如有效性与稳定性已被研究,我们贡献了一个新性质:其在迭代式部分达成(IPF)下的行为。具体而言,收到 CF 解释后,主体可能仅部分达成它,再请求带新解释的新预测,并重复直至预测为正。此类部分达成或因主体能力有限(如此刻仅能偿还四张信用卡账户中的两张),或为碰运气(如赌月薪增 800已够,虽建议为800 已够,虽建议为 1,000)。这种迭代式部分达成会增减主体所承担的总改进成本吗?我们对 IPF 作数学形式化,并从理论与经验上证明不同 CF 算法在 IPF 下呈现迥异行为。我们讨论观察的含义,主张在 CF 算法的开发与研究中须审慎考量此因素,并给出若干未来工作方向。

关键词

引用

@article{arxiv.2303.11111,
  title  = {Iterative Partial Fulfillment of Counterfactual Explanations: Benefits and Risks},
  author = {Yilun Zhou},
  journal= {arXiv preprint arXiv:2303.11111},
  year   = {2023}
}

备注

AIES 2023