中文

神经概念验证器:通过概念编码扩展证明-验证者博弈

机器学习 2026-02-05 v3 人工智能

摘要

虽然证明-验证者博弈(PVG)为非线性分类模型的可验证性提供了可行之路,但尚未应用于诸如高维图像等复杂输入。相反,表征性概念编码能够有效地将此类数据转换为可解释概念,但常用于低容量线性预测器的情境中。本文通过结合两种方法的优势,推进实际可验证性。我们引入神经概念验证器(NCV),一个统一框架,将PVG用于形式可验证性,同时利用概念编码以可解释方式处理复杂的高维输入。NCV通过利用最近的最小监督概念发现模型从原始输入中提取结构化概念编码。随后,证明者选择其中一部分编码,由验证者(实现为非线性预测器)仅使用这些编码进行决策。我们的评估表明,NCV在高维、逻辑复杂的数据集上优于经典概念模型和基于像素的PVG分类器基线,并有助于缓解捷径行为。总体而言,我们展示了NCV是通向概念级别可验证人工智能的有前景的一步。

关键词

引用

@article{arxiv.2507.07532,
  title  = {Neural Concept Verifier: Scaling Prover-Verifier Games via Concept Encodings},
  author = {Berkant Turan and Suhrab Asadulla and David Steinmann and Kristian Kersting and Wolfgang Stammer and Sebastian Pokutta},
  journal= {arXiv preprint arXiv:2507.07532},
  year   = {2026}
}

备注

24 pages, 5 figures, 11 tables, revised references. An earlier version of this work was presented at the ICML 2025 Workshop on Actionable Interpretability