中文

小模型,强先验:面向参数高效神经PDE求解器的架构归纳偏置

机器学习 2026-05-26 v1 人工智能 计算物理

摘要

神经PDE求解器沿用了视觉和语言领域的扩张轨迹,最新基座模型参数规模达到数十亿。我们认为,规模是此领域的糟糕代替品:结构化先验在参数效率方面发挥着超大作用,先验成功与失败的模式本身也揭示了其所捕获的内容。我们以WaveLiT为例,将其构建为结合无损多分辨率离散小波变换、增强线性注意力块、共享权重多尺度特征金字塔和小波域辅助损失的架构。1-1000万参数的WaveLiT模型在八个TheWell基准测试中与100-1000倍规模的基座模型展开竞争,最大收益在于波动和声学主导的基准测试中——此时小波-多尺度先验契合主要动力学结构,小步误差在滚动预测中不引发几何级数放大。跨八个基准联合训练的1000万参数基座变体展现出结构化、可解释的物理迁移模式——在波动-多尺度先验匹配动力学的地方迁移最强,在混沌输运为主的情形下迁移最弱。整个管道可在单块GPU上完成训练。结果表明,小模型的PDE性能由架构归纳偏置而非规模塑造,而先验失效的结构是评估其内容的有用经验信号。

关键词

引用

@article{arxiv.2605.25949,
  title  = {Small Models, Strong Priors: Architectural Inductive Bias for Parameter-Efficient Neural PDE Solvers},
  author = {Shyam Sankaran and Hanwen Wang and Paris Perdikaris},
  journal= {arXiv preprint arXiv:2605.25949},
  year   = {2026}
}