打开 AI 黑箱:基于机制可解释性的程序综合
机器学习
2024-02-08 v1
摘要
我们提出了 MIPS,一种基于对执行期望任务的神经网络进行自动机制可解释性后 distilling 所学习算法 into Python 代码的程序综合新方法。我们在包含 62 个可被 RNN 学习的算法任务的基准测试中测试 MIPS,发现其与 GPT-4 高度互补:MIPS 解决了其中的 32 个任务,其中 13 个任务 GPT-4 未能解决(GPT-4 也仅解决 30 个)。MIPS 使用整数自动编码器将 RNN 转换为有限状态机,然后应用布尔或整数符号回归来捕获所学习的算法。与大型语言模型不同,此程序综合技术无需依赖人类训练数据(如算法和来自 GitHub 的代码),因此不受此类限制。我们讨论了将此方法规模化以使机器学习模型更具可解释性和可信度的机遇与挑战。
引用
@article{arxiv.2402.05110,
title = {Opening the AI black box: program synthesis via mechanistic interpretability},
author = {Eric J. Michaud and Isaac Liao and Vedang Lad and Ziming Liu and Anish Mudide and Chloe Loughridge and Zifan Carl Guo and Tara Rezaei Kheirkhah and Mateja Vukelić and Max Tegmark},
journal= {arXiv preprint arXiv:2402.05110},
year = {2024}
}
备注
24 pages