用全息约简表示重构自注意力机制
机器学习
2023-06-01 v1 人工智能
机器学习
摘要
近年来,自注意力已成为多个领域序列建模的主导范式。然而,在序列长度极长的领域中,的内存与的计算成本可能使使用transformers不可行。受恶意软件检测问题的启发(其中的序列长度是深度学习的障碍),我们使用全息约简表示(HRR)这一神经符号方法重构自注意力。在此过程中,我们执行了标准自注意力的相同高层策略:一组查询与一组键匹配,并为每个键返回值的加权响应。作为“Hrrformer”实现,我们获得了若干益处,包括时间复杂度、空间复杂度,以及少轮次收敛。尽管如此,Hrrformer在LRA基准上达到近最先进精度,且我们仅用单层即可学习。综合来看,这些优势使我们的Hrrformer成为此类长恶意软件分类序列首个可行的Transformer,并在Long Range Arena基准上训练快达。代码可在 \url{https://github.com/NeuromorphicComputationResearchProgram/Hrrformer} 获取。
引用
@article{arxiv.2305.19534,
title = {Recasting Self-Attention with Holographic Reduced Representations},
author = {Mohammad Mahmudul Alam and Edward Raff and Stella Biderman and Tim Oates and James Holt},
journal= {arXiv preprint arXiv:2305.19534},
year = {2023}
}
备注
To appear in Proceedings of the 40th International Conference on Machine Learning (ICML)