中文

DocVCE:面向文档图像分类的扩散式视觉反事实解释

计算机视觉与模式识别 2025-08-07 v1

摘要

随着黑箱 AI 驱动的决策系统在现代文档处理工作流程中广泛应用,提高其透明度和可靠性变得至关重要,尤其是在那些决策中可能包含偏见或伪相关性的高风险应用中。文档图像分类是此类工作流程中常见的关键组成部分,尽管广泛使用,但仍难以解释。虽然近期一些研究尝试通过特征重要性图来解释文档图像分类模型的决策,但这些图往往难以解释,且未能提供模型所学习的全局特征的见解。本文旨在弥合这一研究空白,通过引入生成式文档反事实解释,提供可操作的解释,深入洞察模型的决策过程。具体而言,我们提出 DocVCE,一种新方法,利用潜在扩散模型结合分类器引导,首先生成可信的分布内视觉反事实解释,然后进行层次化的 patch 级细化,以搜索最接近目标事实图像的细化反事实。我们在三个不同的文档分类数据集——RVL-CDIP、Tobacco3482 和 DocLayNet——以及三个不同模型——ResNet、ConvNeXt 和 DiT 上进行了严格的定性和定量评估,使用如有效性、接近度和真实性等既定评估标准。据我们了解,这是首个探索文档图像分析中生成式反事实解释的工作。

关键词

引用

@article{arxiv.2508.04233,
  title  = {DocVCE: Diffusion-based Visual Counterfactual Explanations for Document Image Classification},
  author = {Saifullah Saifullah and Stefan Agne and Andreas Dengel and Sheraz Ahmed},
  journal= {arXiv preprint arXiv:2508.04233},
  year   = {2025}
}