中文

对抗性合作合理化:即使是干净数据集中虚假相关的风险

人工智能 2025-08-07 v5

摘要

本研究探讨了基于合作博弈构建的自我合理化框架,其中生成器首先从原始输入中提取最具信息量的片段,随后预测器利用所选子集作为其输入。生成器和预测器协同训练以最大化预测精度。在本文中,我们首先揭示了一个潜在隐患:这种合作博弈可能在理由提取过程中无意中引入采样偏差。具体来说,生成器可能会在所选理由候选与标签之间无意中创建错误的关联,即使它们在原始数据集中语义上并不相关。随后,我们通过详细的理论分析和实证证据阐明了这种偏差的起源。我们的发现为通过攻击来检查这些相关性指明了方向,基于此,我们进一步引入了一种指令,以防止预测器学习这些相关性。通过在六个文本分类数据集和两个图分类数据集上使用三种网络架构(GRU、BERT 和 GCN)进行的实验,我们表明我们的方法不仅显著优于近期的合理化方法,而且取得了与代表性大语言模型(llama3.1-8b-instruct)相当甚至更好的结果。

关键词

引用

@article{arxiv.2505.02118,
  title  = {Adversarial Cooperative Rationalization: The Risk of Spurious Correlations in Even Clean Datasets},
  author = {Wei Liu and Zhongyu Niu and Lang Gao and Zhiying Deng and Jun Wang and Haozhao Wang and Ruixuan Li},
  journal= {arXiv preprint arXiv:2505.02118},
  year   = {2025}
}

备注

ICML 2025