面向群运算网络的统一与验证理解
机器学习
2025-01-28 v3 机器学习
摘要
最近一线工作在机械可解释性方面聚焦于逆向工程在有限群的二进制运算上训练的神经网络所执行的计算。我们研究训练于该任务的一个隐藏层神经网络的内部结构,揭示了previously未识别的结构,并在一步步统一 previous works 解释的过程中,为该模型提供更完整的描述(Chughtai 等,2023;Stander 等,2024)。值得注意的是,这些模型在每个输入参数上近似等价性。我们通过将其翻译为对模型性能的紧凑证明,进行定量评估,以评估我们在多大程度上忠实且简洁地解释模型内部。在正文中,我们聚焦于对称群 S5。对于在该群上训练的模型,我们的解释可实现比暴力方法快 3 倍的模型准确性保证,并为我们训练的 45% 的模型提供 >=95% 的准确性界限。我们无法仅凭 previous works 的解释获得非平凡的 non-vacuous 准确性界限。
引用
@article{arxiv.2410.07476,
title = {Towards a unified and verified understanding of group-operation networks},
author = {Wilson Wu and Louis Jaburi and Jacob Drori and Jason Gross},
journal= {arXiv preprint arXiv:2410.07476},
year = {2025}
}
备注
ICLR 2025 camera ready. 32 pages, 11 figures