中文

避免泄漏中毒:分布迁移下的概念干预

机器学习 2025-08-05 v3 人工智能 密码学与安全 人机交互

摘要

本文我们研究了概念基模型 (CM) 对分布外 (OOD) 输入的响应。CM 是可解释的神经网络体系结构,首先预测一组高层次概念(如条纹、黑色),然后从这些概念预测任务标签。特别是,我们研究了概念干预(即人类专家在测试时纠正 CM 误预测的概念)对 CM 在 OOD 输入上任务预测的影响。我们的分析揭示了当前最先进 CM 的一种弱点,即称为泄漏中毒的缺陷,使其无法在针对 OOD 输入进行干预时正确提高准确率。为此,我们引入了 MixCEM,一种新型 CM,通过动态地在概念缺失但在分布内的信息仅在需要时被利用来实现此目标。我们的结果在带和不带完整概念注释的任务上都表明,MixCEM 相对于强大基线显著提高了在有或无概念干预情况下,既在分布内又在分布外样本的准确率。

关键词

引用

@article{arxiv.2504.17921,
  title  = {Avoiding Leakage Poisoning: Concept Interventions Under Distribution Shifts},
  author = {Mateo Espinosa Zarlenga and Gabriele Dominici and Pietro Barbiero and Zohreh Shams and Mateja Jamnik},
  journal= {arXiv preprint arXiv:2504.17921},
  year   = {2025}
}

备注

Presented at the Forty-Second International Conference on Machine Learning (ICML 2025). Post-conference manuscript