MMI 准则是否是可解释性必需的?将退化非因果特征退化为纯噪声以实现自我合理化
机器学习
2024-10-23 v4
摘要
解释性领域的一个重要研究方向是从完整输入中提取出小型关键理由子集。用于理由提取的最广泛使用的标准是最大互信息 (MMI) 标准。然而,在某些数据集中,存在与标签非因果相关的虚假特征,这些特征也获得高的互信息,这使得 MMI 的损失景观变得复杂。虽然已开发出一些惩罚性方法来惩罚虚假特征(例如不变性惩罚、干预惩罚等),以帮助 MMI 更好地工作,但这些方法仅是补救措施。在这些方法的优化目标中,虚假特征仍然被区分为纯噪声,这会阻碍发现因果理由的发现。本文旨在开发一种新的标准,将虚假特征视为纯噪声,使模型在虚假特征丰富的数据集上能够像在干净数据集上一样工作,从而简化理由提取过程。我们理论性地观察到,删除输入中的纯噪声或虚假特征并不会改变剩余组成部分相对于任务标签的条件分布。然而,仅当消除因果特征时,条件分布才会发生显著变化。基于此发现,本文提出了最大剩余差异 (MRD) 标准。实验表明,与几种最新竞争的 MMI 变体相比,我们的 MRD 标准在理由质量(即与人工标注理由重叠度)方面提升了最高达 。代码: \url{https://github.com/jugechengzi/Rationalization-MRD}。
引用
@article{arxiv.2410.06003,
title = {Is the MMI Criterion Necessary for Interpretability? Degenerating Non-causal Features to Plain Noise for Self-Rationalization},
author = {Wei Liu and Zhiying Deng and Zhongyu Niu and Jun Wang and Haozhao Wang and YuanKai Zhang and Ruixuan Li},
journal= {arXiv preprint arXiv:2410.06003},
year = {2024}
}
备注
Accepted at NeurIPS 2024. arXiv admin note: text overlap with arXiv:2309.13391