中文

利用层剪枝构建高效的 Sentence BERT 模型

计算与语言 2024-09-24 v1 机器学习

摘要

本研究探讨了层剪枝在构建高效 Sentence BERT (SBERT) 模型中的有效性。我们的目标是构建更小的句子嵌入模型,在降低复杂度的同时保持良好的嵌入相似性。我们在剪枝前后对 Muril 和 MahaBERT-v2 等 BERT 模型进行评估,并将它们与从头训练的小型模型(如 MahaBERT-Small 和 MahaBERT-Smaller)进行比较。通过包含自然语言推理 (NLI) 和语义文本相似性 (STS) 的两阶段 SBERT 微调过程,我们评估了层减少对嵌入质量的影响。研究结果表明,剪枝后的模型尽管层数较少,但其性能与完整层数版本相当。此外,剪枝后的模型始终优于同等规模且从头训练的模型,这确立了层剪枝作为构建更小、更高效嵌入模型的有效策略。这些结果突显了层剪枝作为一种实用方法,能够在保持高质量嵌入的同时减少计算需求,使得 SBERT 模型更易于在技术资源有限的语言中使用。

关键词

引用

@article{arxiv.2409.14168,
  title  = {Towards Building Efficient Sentence BERT Models using Layer Pruning},
  author = {Anushka Shelke and Riya Savant and Raviraj Joshi},
  journal= {arXiv preprint arXiv:2409.14168},
  year   = {2024}
}