通过交叉注意力克服谱偏差
数值分析
2025-12-23 v1 数值分析
摘要
谱偏差意味着训练动力学中的不平衡,使得高频分量的收敛速度显著慢于低频分量。为缓解这一问题,我们提出一种基于交叉注意力的体系结构,通过可学习的缩放因子自适应地对标尺多尺度随机傅里叶特征库进行加权。可学习的缩放调整多尺度随机傅里叶特征的�幅,而交叉注意力残差结构提供一种输入依赖的机制,以强调最具信息量的尺度。结果,该设计相对于基于相同多尺度库构建的其他基线加速了高频收敛。此外,注意力模块支持增量谱丰富:通过离散傅里叶分析从中间近似值中提取的主导傅里叶模式可以附加到特征库中,并用于后续训练,而无需修改背板体系结构。我们进一步将该框架扩展到 PDE 学习,通过引入两个子网络的线性组合:一个专注于捕捉 PDE 解的高频分量,另一个专注于捕捉低频分量,以及一个可学习的 (或最优选择的) 混合因子来平衡两个贡献并提高在振荡 regime 中的训练效率。数值实验在高频和不连续回归问题、图像重建任务以及各代表性 PDE 示例中,都表明了该方法的有效性和鲁棒性。
引用
@article{arxiv.2512.18586,
title = {Overcoming Spectral Bias via Cross-Attention},
author = {Xiaodong Feng and Tao Tang and Xiaoliang Wan and Tao Zhou},
journal= {arXiv preprint arXiv:2512.18586},
year = {2025}
}
备注
25 pages, 21 figures