BERT-LSH:降低注意力机制的绝对计算量
计算与语言
2024-04-16 v1 人工智能
机器学习
摘要
本研究引入了一种新颖的 BERT-LSH 模型,该模型结合了局部敏感哈希(Locality Sensitive Hashing, LSH)来近似 BERT 架构中的注意力机制。我们考察了该模型与标准基线 BERT 模型相比的计算效率和性能。研究结果表明,BERT-LSH 显著降低了自注意力层的计算需求,同时在预训练和微调任务中意外地超越了基线模型。这些结果表明,基于 LSH 的注意力机制不仅提供了计算上的优势,还可能增强了模型从训练数据中泛化的能力。更多信息,请访问我们的 GitHub 仓库:https://github.com/leo4life2/algoml-final
引用
@article{arxiv.2404.08836,
title = {BERT-LSH: Reducing Absolute Compute For Attention},
author = {Zezheng Li and Kingston Yip},
journal= {arXiv preprint arXiv:2404.08836},
year = {2024}
}
备注
10 pages, 5 figures