了解你无法解释的东西:学习拒绝低质量解释
机器学习
2026-03-19 v3
摘要
学习拒绝(LtR)框架允许 ML 模型对不可信预测进行中止,从而促进用户信任。然而,由于当前 LtR 策略仅关注预测性能,完全忽略了解释质量。低质量解释——无论它们是否准确反映模型的推理,还是未满足用户需求——都可能严重削弱信任评估,导致对错误预测的过度依赖。我们认为,模型应在无法提供满意解释时中止预测,并提出了学习拒绝低质量解释(LtX)的框架,其中预测器配备评估解释质量的拒绝器。我们关注流行的归因技术,提出了 REX(REjector of low-quality eXplanations),该模型综合了机器侧判断与显式人类标注,以评估解释质量。我们的实证评估表明,\method 优于流行的 LtR 策略和依赖单一解释指标的基线方法。最后,为支持未来研究,我们公开了一个更大规模的、包含1050 项人类标注机器解释的数据集。
引用
@article{arxiv.2507.12900,
title = {Knowing What You Cannot Explain: Learning to Reject Low-Quality Explanations},
author = {Luca Stradiotti and Dario Pesenti and Stefano Teso and Jesse Davis},
journal= {arXiv preprint arXiv:2507.12900},
year = {2026}
}