中文

异议式解释:利用分歧降低模型过度依赖

人工智能 2024-08-09 v3

摘要

尽管可解释性是日益复杂的黑盒模型所期望的特性,但现代解释方法已被证明是不一致且矛盾的。解释语义并非总被充分理解——解释在多大程度上“解释”了决策,又在多大程度上仅仅是为决策辩护?我们能否帮助人类从伴随正确预测的解释中获得洞见,而不对解释所辩护的错误预测过度依赖?秉持该视角,我们引入异议式解释的概念:带有伴随解释的冲突预测。我们首先在模型 multiplicity 情形下探讨异议式解释的优势,即多个性能相近的模型可能有不同预测。在此类情形中,提供异议式解释可通过调用持异议模型的解释来实现。通过一项试点研究,我们证明异议式解释降低了对模型预测的过度依赖,且不降低整体准确率。受异议式解释效用的启发,我们提出其全局与局部生成方法。

关键词

引用

@article{arxiv.2307.07636,
  title  = {Dissenting Explanations: Leveraging Disagreement to Reduce Model Overreliance},
  author = {Omer Reingold and Judy Hanwen Shen and Aditi Talati},
  journal= {arXiv preprint arXiv:2307.07636},
  year   = {2024}
}

备注

V2: AAAI 2024 V1: AI & HCI Workshop at ICML 2023