中文

Peter Parker 还是蜘蛛侠?多类别标签的消歧

计算机视觉与模式识别 2024-10-28 v1 人工智能

摘要

在监督分类设置中,深度网络在推理阶段通常会做出多个预测。对于一对这样的预测(即位于 top-k 预测中的两个),可能发生两种不同的情况。一方面,这两个预测可能分别主要由输入中两组不同的实体驱动。另一方面,也可能存在单个实体或一组实体同时驱动了这两个类别的预测。后一种情况实际上对应于网络对单一实体类型的身份做出了两个不同的猜测。显然,这两个猜测不可能同时为真,即这两个标签不可能同时出现在输入中。当前可解释性研究的技术通常一次只考虑一个类别标签的输入归因,因此无法轻易区分这两种情况。在此,我们提出一个框架和方法来实现这一目标,利用现代分割和输入归因技术。值得注意的是,我们的框架还为每种情况提供了一个简单的反事实“证明”,该证明可以在模型上针对输入进行验证(即无需再次运行该方法)。我们证明了该方法在 ImageNet 验证集的多个样本以及多个模型上均表现良好。

关键词

引用

@article{arxiv.2410.19479,
  title  = {Peter Parker or Spiderman? Disambiguating Multiple Class Labels},
  author = {Nuthan Mummani and Simran Ketha and Venkatakrishnan Ramaswamy},
  journal= {arXiv preprint arXiv:2410.19479},
  year   = {2024}
}

备注

Accepted to Neural Information Processing Systems (NeurIPS 2024). ATTRIB Workshop