面向ReLU与加法结构Transformer的InhibiDistilBERT:知识蒸馏
计算与语言
2025-03-21 v1 人工智能
机器学习
摘要
本工作探讨了通过将模型压缩技术与抑制注意力机制集成来优化基于Transformer的语言模型。在hibitor注意力中,我们采用曼哈顿距离和ReLU激活函数,代替常规缩放点积注意力中的矩阵乘法和softmax激活。这一变更可能在保持模型有效性的同时,实现计算和能源节省。我们进一步提出了若干调整,以提高抑制机制的训练效率,并在DistilBERT架构上进行评估。我们的知识蒸馏实验表明,修改后的抑制Transformer模型可在标准NLP基准测试中取得具竞争力的性能,包括通用语言理解评估(GLUE)和情感分析任务。
引用
@article{arxiv.2503.15983,
title = {InhibiDistilbert: Knowledge Distillation for a ReLU and Addition-based Transformer},
author = {Tony Zhang and Rickard Brännvall},
journal= {arXiv preprint arXiv:2503.15983},
year = {2025}
}
备注
7 pages, 2 tables