持久同调能否白盒化基于Transformer的黑盒模型?以BERT压缩为例的研究
机器学习
2025-04-22 v1 人工智能
摘要
诸如BERT之类的大型语言模型(LLM)因其在各种自然语言处理任务中的卓越性能而备受瞩目。然而,它们伴随着巨大的计算和内存开销。此外,它们本质上是黑盒模型,难以解释和阐释。在本文中,我们提出了Optimus BERT压缩与可解释性(OBCE),这是一种利用持久同调为BERT模型引入可解释性的方法,旨在通过研究神经元输出的拓扑特征来衡量每个神经元的重要性。结果,我们可以通过减少参数数量(BERT Base保留原始参数的58.47%,BERT Large为52.3%)来显著压缩BERT。我们在标准GLUE基准上评估了我们的方法,将结果与最先进的技术进行了比较,并取得了出色的结果。因此,我们的方法可以通过为其神经元提供可解释性并减小模型规模来“白盒化”BERT模型,使其更适合部署在资源受限的设备上。
引用
@article{arxiv.2312.10702,
title = {Can persistent homology whiten Transformer-based black-box models? A case study on BERT compression},
author = {Luis Balderas and Miguel Lastra and José M. Benítez},
journal= {arXiv preprint arXiv:2312.10702},
year = {2025}
}