中文

基于Kronecker结构注意力的高阶Transformer

机器学习 2025-11-19 v2 人工智能

摘要

现代数据集日益高维且多向,常表示为具有多索引变量的张量值数据。虽然Transformer在序列建模和高维任务中表现出色,但其直接应用于多向数据在计算上不可行,因为点积注意力的二次计算成本以及需要弯曲输入的情况,这会破坏张量结构和跨维依赖。我们提出了高阶Transformer(HOT),一种新的分解注意力框架,将多向注意力表示为Kronecker积或模式相关注意力矩阵之和。HOT有效地捕获跨维度的稠密和稀疏关系,同时保持张量结构。理论上,HOT保留了完全高阶注意力的表达能力,并允许通过分解秩控制复杂度。在2D和3D数据集上的实验表明,HOT在多变量时间序列预测和图像分类方面实现了与竞争性能相当的性能,同时显著降低了计算和内存成本。模式相关注意力矩阵的可视化进一步揭示了HOT学习到的可解释的高阶依赖,表明其在各种领域的复杂多向数据处理具有广泛的灵活性。我们的方法实现已公开于https://github.com/s-omranpour/HOT。

关键词

引用

@article{arxiv.2412.02919,
  title  = {Higher-Order Transformers With Kronecker-Structured Attention},
  author = {Soroush Omranpour and Guillaume Rabusseau and Reihaneh Rabbany},
  journal= {arXiv preprint arXiv:2412.02919},
  year   = {2025}
}