中文

MATEY:用于时空物理系统的多尺度自适应基础模型

机器学习 2024-12-31 v1 人工智能 计算工程、金融与科学

摘要

使用视觉转换器 (ViT) 架构对时空物理系统特征的多尺度表示需要极长的、计算昂贵的 token 序列。为此,我们提出了两种自适应分词方案,根据局部特征动态调整 patch 大小:一种确保收敛到均匀分辨率,另一种提供更好的计算效率。此外,我们提出了一组时空注意力方案,其中解耦了时间或轴向空间维度,并评估了其计算和数据效率。我们在一系列实验中评估了所提出的多尺度自适应模型 MATEY 的性能。结果表明,自适应分词方案在不显著增加 token 序列长度的情况下实现了 improved 的准确率。与完整时空注意力方案或仅解耦时间维度的方案相比,我们发现完全解耦轴向注意力在效率和表达性方面较差,需要更多的训练时间和模型参数才能达到相同的准确率。最后,在两个包含不同物理特征的微调任务中,我们展示了在 PDEBench 数据上预训练的模型在低数据 regime 下尤其优于从头训练的模型,尤其是在冻结注意力的情况下。

关键词

引用

@article{arxiv.2412.20601,
  title  = {MATEY: multiscale adaptive foundation models for spatiotemporal physical systems},
  author = {Pei Zhang and M. Paul Laiu and Matthew Norman and Doug Stefanski and John Gounley},
  journal= {arXiv preprint arXiv:2412.20601},
  year   = {2024}
}