Computation and Language · Computer Science
SKDBERT: Compressing BERT via Stochastic Knowledge Distillation
Zixiang Ding, Guoqing Jiang, Shuai Zhang, Lin Guo +1
2022-11-30
Computation and Language · Computer Science
DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter
Victor Sanh, Lysandre Debut, Julien Chaumond, Thomas Wolf
2020-03-03
Machine Learning · Computer Science
NoiseFormer -- Noise Diffused Symmetric Attention Transformer
Phani Kumar, Nyshadham, Jyothendra Varma, Polisetty V R K +1
2026-01-21
Computation and Language · Computer Science
Improving Question Answering Performance Using Knowledge Distillation and Active Learning
Yasaman Boreshban, Seyed Morteza Mirbostani, Gholamreza Ghassem-Sani, Seyed Abolghasem Mirroshandel +1
2021-09-28
Computation and Language · Computer Science
TinyBERT: Distilling BERT for Natural Language Understanding
Xiaoqi Jiao, Yichun Yin, Lifeng Shang, Xin Jiang +4
2020-10-19
Computation and Language · Computer Science
KDLSQ-BERT: A Quantized Bert Combining Knowledge Distillation with Learned Step Size Quantization
Jing Jin, Cai Liang, Tiancheng Wu, Liqin Zou +1
2021-01-18
Computation and Language · Computer Science
QuaLA-MiniLM: a Quantized Length Adaptive MiniLM
Shira Guskin, Moshe Wasserblat, Chang Wang, Haihao Shen
2023-05-11
Computation and Language · Computer Science
Blockwise Self-Attention for Long Document Understanding
Jiezhong Qiu, Hao Ma, Omer Levy, Scott Wen-tau Yih +2
2020-11-03
Computation and Language · Computer Science
LadaBERT: Lightweight Adaptation of BERT through Hybrid Model Compression
Yihuan Mao, Yujing Wang, Chufan Wu, Chen Zhang +5
2020-10-22
Machine Learning · Computer Science
From Sparsity to Simplicity: Enabling Simpler Sequential Replacements via Sparse Attention Distillation
Yuxin Ren, Maxwell D Collins, Miao Hu, Huanrui Yang
2026-05-20
Machine Learning · Computer Science
Efficient Content-Based Sparse Attention with Routing Transformers
Aurko Roy, Mohammad Saffar, Ashish Vaswani, David Grangier
2020-10-27
Computation and Language · Computer Science
SpikeBERT: A Language Spikformer Learned from BERT with Knowledge Distillation
Changze Lv, Tianlong Li, Jianhan Xu, Chenxi Gu +4
2024-02-22
Computation and Language · Computer Science
Dynamic-TinyBERT: Boost TinyBERT's Inference Efficiency by Dynamic Sequence Length
Shira Guskin, Moshe Wasserblat, Ke Ding, Gyuwan Kim
2021-11-19
Computer Vision and Pattern Recognition · Computer Science
Optimizing Knowledge Distillation in Transformers: Enabling Multi-Head Attention without Alignment Barriers
Zhaodong Bing, Linze Li, Jiajun Liang
2025-02-12
Machine Learning · Computer Science
Big Bird: Transformers for Longer Sequences
Manzil Zaheer, Guru Guruganesh, Avinava Dubey, Joshua Ainslie +7
2021-01-11
Computation and Language · Computer Science
TernaryBERT: Distillation-aware Ultra-low Bit BERT
Wei Zhang, Lu Hou, Yichun Yin, Lifeng Shang +3
2020-10-13
Computation and Language · Computer Science
Prune Once for All: Sparse Pre-Trained Language Models
Ofir Zafrir, Ariel Larey, Guy Boudoukh, Haihao Shen +1
2021-11-11
Computation and Language · Computer Science
Does Self-Attention Need Separate Weights in Transformers?
Md Kowsher, Nusrat Jahan Prottasha, Chun-Nam Yu, Ozlem Ozmen Garibay +1
2025-05-05
Computation and Language · Computer Science
Sparser is Faster and Less is More: Efficient Sparse Attention for Long-Range Transformers
Chao Lou, Zixia Jia, Zilong Zheng, Kewei Tu
2024-06-25