中文

非局部注意力算子:实现隐含知识以促进可解释的物理发现

机器学习 2024-08-15 v1 偏微分方程分析

摘要

尽管基于注意力的神经网络架构在自然语言处理 (NLP) 和计算机视觉 (CV) 等核心 AI 领域近期广受欢迎,但它们在建模复杂物理系统方面的潜力仍未被充分探索。物理系统中的学习问题通常被表征为基于少量函数对实例发现在函数空间之间映射的算子。这一任务通常表现为一个严重不适定的偏微分方程 (PDE) 反问题。在本工作中,我们提出了一种基于注意力机制的新型神经算子架构,我们将其命名为非局部注意力算子 (NAO),并探索其在开发基础物理模型方面的能力。具体而言,我们证明注意力机制等价于一个二重积分算子,能够在空间标记之间实现非局部交互,并具有一个依赖于数据的核,该核表征了从数据到底层算子隐藏参数场的逆映射。因此,注意力机制从多个系统生成的训练数据中提取全局先验信息,并以非线性核映射的形式建议探索空间。因此,NAO 可以通过编码正则化来解决不适定性和秩亏缺问题,从而实现泛化。我们从经验上证明了 NAO 相对于基线神经模型在泛化到未见数据分辨率和系统状态方面的优势。我们的工作不仅提出了一种用于学习物理系统可解释基础模型的新型神经算子架构,还为理解注意力机制提供了新的视角。

关键词

引用

@article{arxiv.2408.07307,
  title  = {Nonlocal Attention Operator: Materializing Hidden Knowledge Towards Interpretable Physics Discovery},
  author = {Yue Yu and Ning Liu and Fei Lu and Tian Gao and Siavash Jafarzadeh and Stewart Silling},
  journal= {arXiv preprint arXiv:2408.07307},
  year   = {2024}
}