大规模语言模型是可靠的 AI 科学家吗?评估黑箱系统的逆向工程
机器学习
2025-05-26 v1 人工智能
计算与语言
摘要
利用 AI 创建自主研究者有望加速科学发现。这一愿景的前提是理解 AI 模型在多大程度上能够从行为中识别黑箱系统的底层结构。在本文中,我们探索了大规模语言模型(LLM)在从被动观测数据与主动收集数据中学习识别黑箱函数的能力。我们考察了 LLM 在三种不同类型的黑箱系统中的逆向工程能力,每种类型 chosen to represent 不同的未来自主 AI 研究者可能产生重大影响的问题领域:程序、形式语言和数学方程。通过大量实验,我们表明 LLM 无法从观测中提取信息,达到的性能平台期远低于贝叶斯推断的理想。然而,我们证明提示 LLM 不仅观测而且干预——通过主动用特定输入查询黑箱以观察产生的输出——能够通过允许 LLM 测试边界情况并完善其信念来提升性能。通过将一个 LLM 的干预数据提供给另一个 LLM,我们表明这种提升部分源于参与生成有效干预的过程,这与人类学习文献中的结果相呼应。进一步分析表明,参与干预可以帮助 LLM 逃离两种常见失败模式:过度复杂化,即 LLM 错误地假设了对黑箱的先验知识;以及忽略,即 LLM 未能整合观测结果。这些见解为帮助 LLM 更有效地逆向工程黑箱系统提供了实用指导,支持其用于新发现。
引用
@article{arxiv.2505.17968,
title = {Are Large Language Models Reliable AI Scientists? Assessing Reverse-Engineering of Black-Box Systems},
author = {Jiayi Geng and Howard Chen and Dilip Arumugam and Thomas L. Griffiths},
journal= {arXiv preprint arXiv:2505.17968},
year = {2025}
}
备注
30 pages