中文

BERT-LSH:降低注意力机制的绝对计算量

计算与语言 2024-04-16 v1 人工智能 机器学习

摘要

本研究引入了一种新颖的 BERT-LSH 模型,该模型结合了局部敏感哈希(Locality Sensitive Hashing, LSH)来近似 BERT 架构中的注意力机制。我们考察了该模型与标准基线 BERT 模型相比的计算效率和性能。研究结果表明,BERT-LSH 显著降低了自注意力层的计算需求,同时在预训练和微调任务中意外地超越了基线模型。这些结果表明,基于 LSH 的注意力机制不仅提供了计算上的优势,还可能增强了模型从训练数据中泛化的能力。更多信息,请访问我们的 GitHub 仓库:https://github.com/leo4life2/algoml-final

关键词

引用

@article{arxiv.2404.08836,
  title  = {BERT-LSH: Reducing Absolute Compute For Attention},
  author = {Zezheng Li and Kingston Yip},
  journal= {arXiv preprint arXiv:2404.08836},
  year   = {2024}
}

备注

10 pages, 5 figures