中文

用全息约简表示重构自注意力机制

机器学习 2023-06-01 v1 人工智能 机器学习

摘要

近年来,自注意力已成为多个领域序列建模的主导范式。然而,在序列长度极长的领域中,O(T2)\mathcal{O}(T^2)的内存与O(T2H)\mathcal{O}(T^2 H)的计算成本可能使使用transformers不可行。受恶意软件检测问题的启发(其中T100,000T \geq 100,000的序列长度是深度学习的障碍),我们使用全息约简表示(HRR)这一神经符号方法重构自注意力。在此过程中,我们执行了标准自注意力的相同高层策略:一组查询与一组键匹配,并为每个键返回值的加权响应。作为“Hrrformer”实现,我们获得了若干益处,包括O(THlogH)\mathcal{O}(T H \log H)时间复杂度、O(TH)\mathcal{O}(T H)空间复杂度,以及少10×10\times轮次收敛。尽管如此,Hrrformer在LRA基准上达到近最先进精度,且我们仅用单层即可学习。综合来看,这些优势使我们的Hrrformer成为此类长恶意软件分类序列首个可行的Transformer,并在Long Range Arena基准上训练快达280×280\times。代码可在 \url{https://github.com/NeuromorphicComputationResearchProgram/Hrrformer} 获取。

关键词

引用

@article{arxiv.2305.19534,
  title  = {Recasting Self-Attention with Holographic Reduced Representations},
  author = {Mohammad Mahmudul Alam and Edward Raff and Stella Biderman and Tim Oates and James Holt},
  journal= {arXiv preprint arXiv:2305.19534},
  year   = {2023}
}

备注

To appear in Proceedings of the 40th International Conference on Machine Learning (ICML)