DocXplain:面向文档图像分类的新型模型无关可解释性方法
计算机视觉与模式识别
2024-07-08 v1
摘要
深度学习(DL)已在文档图像分析领域实现超越人类的性能,涵盖多样化任务。然而,其内在的黑箱本质仍是其在工业领域安全可靠部署的主要挑战。令人遗憾的是,尽管近年来大量研究致力于构建基于深度学习的文档分析系统,但致力于提升透明度的研究相对稀少。本文旨在弥合这一研究空白,提出 DocXplain,一种专为文档图像分类生成高可解释性特征归因图的模型无关可解释性方法。具体而言,本方法独立对文档的前景与背景特征进行分割,以不同文档元素形式呈现,然后对这些元素进行消失(ablating)以确定特征重要性。我们在文档图像分类任务中广泛评估了所提方法,采用 4 种评估指标、2 大型公认文档基准数据集以及 10 种最先进的文档图像分类模型。通过对 9 种现代可解释性方法进行详尽的定性与定量分析,结果表明该方法在忠实性与可解释性方面均表现优异。据我们所知,本工作是首个专为文档图像设计的模型无关归因型可解释性方法。我们预期本研究将显著推动文档图像分类模型透明性、公平性与鲁棒性相关研究的发展。
引用
@article{arxiv.2407.03830,
title = {DocXplain: A Novel Model-Agnostic Explainability Method for Document Image Classification},
author = {Saifullah Saifullah and Stefan Agne and Andreas Dengel and Sheraz Ahmed},
journal= {arXiv preprint arXiv:2407.03830},
year = {2024}
}
备注
Accepted in ICDAR 2024