文本训练的LLM可以零样本外推PDE动力学,揭示三阶段上下文学习机制
机器学习
2026-03-13 v3
摘要
大语言模型(LLMs)已在广泛的任务中展现出涌现的上下文学习(ICL)能力,包括零样本时间序列预测。我们证明,经过文本训练的基础模型可以在无需微调或自然语言提示的情况下,准确地外推离散化偏微分方程(PDE)解的时空动力学。预测精度随时间上下文长度的增加而提升,但在空间离散化更精细时下降。在多步展开中,模型递归地预测多个时间步的未来空间状态,误差随时间范围代数式增长,类似于经典有限差分求解器中的全局误差累积。我们将这些趋势解释为上下文神经网络缩放定律,其中预测质量随上下文长度和输出长度可预测地变化。为更好地理解LLMs如何在内部处理PDE解以准确展开它们,我们分析了标记级输出分布,并发现了一致的三阶段ICL进展:从句法模式模仿开始,经过探索性高熵阶段,最终以自信的、基于数值的预测收尾。
引用
@article{arxiv.2509.06322,
title = {Text-Trained LLMs Can Zero-Shot Extrapolate PDE Dynamics, Revealing a Three-Stage In-Context Learning Mechanism},
author = {Jiajun Bao and Nicolas Boullé and Toni J. B. Liu and Raphaël Sarfati and Christopher J. Earls},
journal= {arXiv preprint arXiv:2509.06322},
year = {2026}
}