多网格算法与视觉转换器的协同:提升地震基础模型的新方法
计算机视觉与模式识别
2025-11-19 v1 人工智能
数值分析
数值分析
摘要
由于人工智能技术开发的紧急性和同质化,基于转换器的基础模型已在药物发现、材料研究和天文学等科学应用中取得革命性进展。然而,地震数据具有独特特征,要求 specialized处理技术才能在地震语境下进行预训练基础模型,因其高频和低频特征发挥关键作用。现有视觉转换器(ViT)采用顺序标记化,忽略数据内在结构,无法有效捕获高频和低频地震信息。本文引入一种新型自适应双网格基础模型训练策略(ADATG),用于地震图谱数据,并采用希尔伯特编码。具体而言,我们的方法采用频谱分解分离高频和低频成分,利用层次化希尔伯特编码有效表示数据。此外,观察ViT中的频率原理,我们提出自适应训练策略:初始强调粗糙层次信息,然后逐步细化模型对细粒度特征的关注。我们的大量实验表明,这些训练方法的有效性和效率。该研究强调了考虑高频和低频特征在地震图像中独特特征的数据编码和训练策略的重要性,最终促进了视觉地震基础模型预训练的提升。
引用
@article{arxiv.2511.13800,
title = {Synergizing Multigrid Algorithms with Vision Transformer: A Novel Approach to Enhance the Seismic Foundation Model},
author = {Huiwen Wu and Shuo Zhang and Yi Liu and Hongbin Ye},
journal= {arXiv preprint arXiv:2511.13800},
year = {2025}
}