通过自我反思克服图可解释性中的虚假相关性
机器学习
2026-01-26 v2 人工智能
摘要
可解释图学习近期已成为机器学习中的热门研究课题。其目标是识别输入图中对执行特定图推理任务至关重要的节点和边。该领域已开展大量研究,并提出了多种基准数据集以促进评估。其中最具挑战性之一的是 ICLR 2022 上引入的 Spurious-Motif 基准。该合成基准中的数据集被刻意设计为包含虚假相关性,使得模型难以区分真正相关的结构与误导性模式。因此,与其他基准相比,现有方法在该基准上的表现显著较差。本文聚焦于提升在具有挑战性的 Spurious-Motif 数据集上的可解释性。我们证明,在大型语言模型中常用于处理复杂任务的自我反思技术,也可被有效适配以增强具有强虚假相关性数据集的可解释性。具体而言,我们提出了一个自我反思框架,可与现有的可解释图学习方法集成。当此类方法为每个节点和边生成重要性分数时,我们的框架将这些预测反馈至原方法中进行第二轮评估。这一迭代过程类似于大型语言模型采用自我反思提示来重新评估其先前输出的方式。我们进一步从图表示学习的角度分析了该提升背后的原因,这促使我们提出了一种基于此反馈机制的微调训练方法。
引用
@article{arxiv.2601.11021,
title = {Combating Spurious Correlations in Graph Interpretability via Self-Reflection},
author = {Kecheng Cai and Chenyang Xu and Chao Peng and Jiafu Huang and Qiyuan Liang and Irene Zheng},
journal= {arXiv preprint arXiv:2601.11021},
year = {2026}
}