基于检索增强生成的方法从神经网络中提取算法逻辑
计算机视觉与模式识别
2026-05-19 v2 软件工程
摘要
复用现有神经网络组件是研究效率的核心因素,但在数千个开源仓库中发现、提取和验证此类模块仍然具有挑战性。我们引入了 NN-RAG(Neural Network Retrieval-Augmented Generation),一个检索增强生成系统,将大型异构的 PyTorch 代码库转换为可搜索且可验证的神经模块库。不同于传统代码搜索或克隆检测工具,NN-RAG 执行范围感知的依赖解析、保留导入的重构以及验证器门控的晋升,确保每个检索的代码块都在范围内封闭、可编译且可运行。应用于 19 个主要仓库,该管道提取了 1,289 个候选模块,验证了 941 个(73.0%),并证明了超过 80% 的模块在结构上是唯一的。通过多级去重(精确、词法、结构),我们发现 NN-RAG 为 LEMUR 数据集贡献了绝大部分唯一的网络结构,约占所有新颖网络结构的 72%。除了数量外,NN-RAG 独特地实现了跨仓库的架构模式迁移,自动识别一个项目中的可重用模块并在另一个上下文中生成依赖完整的模块。据我们了解,目前没有其他开源系统能够按比例提供此功能。该框架的中性规范进一步允许可选地集成语言模型进行合成或数据集注册,而无需重新分发第三方代码。总体而言,NN-RAG 将碎片化的视觉代码转换为可复现、可追溯来源的算法发现基质,提供了一个首个开源解决方案,既能定量又能扩大跨仓库可执行神经网络架构的多样性。
引用
@article{arxiv.2512.04329,
title = {A Retrieval-Augmented Generation Approach to Extracting Algorithmic Logic from Neural Networks},
author = {Waleed Khalid and Dmitry Ignatov and Radu Timofte},
journal= {arXiv preprint arXiv:2512.04329},
year = {2026}
}