中文

针对层次化点云数据天然可训练稀疏注意力

机器学习 2025-08-15 v1 人工智能

摘要

通过克服注意力机制的二次方尺度扩张,才能充分发挥变换器在大型物理系统数据集上的潜力。本文探索将 Erwin 架构与本机稀疏注意力(NSA)机制结合,以提高大规模物理系统变换器模型的效率和感受野,解决注意力复杂度的二次方问题。我们为非序列数据适配 NSA 机制,实现 Erwin NSA 模型,并在来自物理科学的三个数据集上进行评估——宇宙学模拟、分子动力学和空气压力建模——实现与原始 Erwin 模型相同或更好的性能。此外,我们复现了 Erwin 论文的实验结果以验证其实现。

关键词

引用

@article{arxiv.2508.10758,
  title  = {Natively Trainable Sparse Attention for Hierarchical Point Cloud Datasets},
  author = {Nicolas Lapautre and Maria Marchenko and Carlos Miguel Patiño and Xin Zhou},
  journal= {arXiv preprint arXiv:2508.10758},
  year   = {2025}
}