针对层次化点云数据天然可训练稀疏注意力
机器学习
2025-08-15 v1 人工智能
摘要
通过克服注意力机制的二次方尺度扩张,才能充分发挥变换器在大型物理系统数据集上的潜力。本文探索将 Erwin 架构与本机稀疏注意力(NSA)机制结合,以提高大规模物理系统变换器模型的效率和感受野,解决注意力复杂度的二次方问题。我们为非序列数据适配 NSA 机制,实现 Erwin NSA 模型,并在来自物理科学的三个数据集上进行评估——宇宙学模拟、分子动力学和空气压力建模——实现与原始 Erwin 模型相同或更好的性能。此外,我们复现了 Erwin 论文的实验结果以验证其实现。
引用
@article{arxiv.2508.10758,
title = {Natively Trainable Sparse Attention for Hierarchical Point Cloud Datasets},
author = {Nicolas Lapautre and Maria Marchenko and Carlos Miguel Patiño and Xin Zhou},
journal= {arXiv preprint arXiv:2508.10758},
year = {2025}
}