中文

CAuSE: 利用忠实自然语言解释解码多模态分类器

计算与语言 2025-12-09 v1 人工智能

摘要

多模态分类器作为不透明的黑箱模型运行。虽然存在多种技术来解释其预测结果,但很少有像自然语言解释(NLE)这样直观且易于理解的。为了建立信任,此类解释必须忠实捕捉分类器的内部决策行为,这一特性被称为忠实性(faithfulness)。本文,我们提出 CAuSE(Simulated Explanations 下的因果抽象,Causal Abstraction under Simulated Explanations),一个用于为任意预训练多模态分类器生成忠实 NLE 的新型框架。我们通过广泛的实证评估证明了 CAuSE 跨数据集和模型的泛化能力。理论上,我们证明通过互换干预(interchange intervention)训练的 CAuSE 构成了底层分类器的因果抽象。我们进一步通过重新设计的度量标准来验证这一点,该标准用于测量多模态设置下的因果忠实性。CAuSE 在该度量上超越了其他方法,定性分析进一步印证了其优势。我们进行了详细的错误分析以确定 CAuSE 的失败案例。为便于复现,我们在 https://github.com/newcodevelop/CAuSE 公开了代码。

关键词

引用

@article{arxiv.2512.06814,
  title  = {CAuSE: Decoding Multimodal Classifiers using Faithful Natural Language Explanation},
  author = {Dibyanayan Bandyopadhyay and Soham Bhattacharjee and Mohammed Hasanuzzaman and Asif Ekbal},
  journal= {arXiv preprint arXiv:2512.06814},
  year   = {2025}
}

备注

Accepted at Transactions of the Association for Computational Linguistics (TACL). Pre-MIT Press publication version