中文

物理基础模型:大规模神经网络的固定硬件实现

机器学习 2026-05-01 v1 新兴技术 神经与进化计算

摘要

基础模型是在大型数据集上训练的深度神经网络(如 GPT-5、Gemini 3 和 Opus 4),能够执行多种下游任务——文本与代码生成、问答、摘要、图像分类等。基础模型的理念是致力于构建一个单一、大规模(约 101210^{12} 参数)的通用模型,无需或仅需极少的额外训练即可适应众多下游任务。我们认为,基础模型的兴起为硬件工程师带来了机遇:与以往不同任务使用不同模型的情况相反,现在构建专用的、固定的神经网络硬件实现变得有意义,可以按照主要新基础模型版本大约 1 年的发布周期进行制造和发布。除了带有只读权重存储器的传统数字电子推理硬件之外,我们倡导一种更彻底的反思:一种硬件,其中神经网络直接在物理设计层面实现,并通过硬件的自然物理动力学运行——即物理基础模型(PFMs)。PFMs 可以在能效、速度和参数密度方面实现数量级的优势。对于约 101210^{12} 参数的模型,这既能减轻数据中心人工智能的高能耗负担,也能在目前因功耗限制而只能运行小得多的模型的边缘设备上实现人工智能。PFMs 还可以为比当前模型大得多的模型提供推理硬件:根据某些衡量标准,101510^{15} 甚至 101810^{18} 参数的 PFMs 似乎是可行的。我们通过一个光学示例——一种三维纳米结构玻璃介质——展示了说明 PFM 扩展的粗略计算,并讨论了在纳米电子学和其他物理平台上的前景。我们最后总结了实现万亿参数级及更大规模 PFMs 所必须解决的主要研究挑战。

关键词

引用

@article{arxiv.2604.27911,
  title  = {Physical Foundation Models: Fixed hardware implementations of large-scale neural networks},
  author = {Logan G Wright and Tianyu Wang and Tatsuhiro Onodera and Peter L. McMahon},
  journal= {arXiv preprint arXiv:2604.27911},
  year   = {2026}
}