带共享得分的四元数自注意力
机器学习
2026-05-26 v1 人工智能
机器学习
摘要
四元数神经网络参数高效,通过将四个相关特征表示为单个实体来建模多维依赖性。然而,现有的四元数自注意力计算每个 component 的得分并对每个 component 应用独立的 softmax 操作,这增加了计算成本并允许注意力分布在 components 之间发散。我们提出一种 shared-score 四元数自注意力机制,该机制使用四元数内积计算单个 real 值得分,并在所有 components 之间应用共享注意力分布。这减少了 score-computation 乘法运算 75%,softmax 操作次数从 four 减少到一个。我们证明,当查询和键由产生 component pre-mixing 的四元数线性投影时,component-wise 和 shared 的得分位于相同的 interaction 子空间中,表明独立的 component-wise 注意力主要是 re-parameterization 相同的 interactions 而非扩展 feature interaction 空间。 在语音增强中,该方法在 GPU 上减少推理时间最高可达 44.3%,在 CPU 上减少 58.1%,同时保持 quality, 在 vision 和 natural language processing 中保持一致趋势。
引用
@article{arxiv.2605.24920,
title = {Quaternion Self-Attention with Shared Scores},
author = {Shogo Yamauchi and Tohru Nitta and Hideaki Tamori},
journal= {arXiv preprint arXiv:2605.24920},
year = {2026}
}
备注
26 pages, 6 figures and 15 tables. Accepted at ICML2026