Computation and Language · Computer Science
Towards Fully 8-bit Integer Inference for the Transformer Model
Ye Lin, Yanyang Li, Tengbo Liu, Tong Xiao +2
2020-09-21
Machine Learning · Computer Science
Efficient 8-Bit Quantization of Transformer Neural Machine Language Translation Model
Aishwarya Bhandare, Vamsi Sripathi, Deepthi Karkada, Vivek Menon +3
2019-06-10
Performance · Computer Science
Exploring the Potential of Flexible 8-bit Format: Design and Algorithm
Zhuoyi Zhang, Yunchen Zhang, Gonglei Shi, Yu Shen +5
2023-10-30
Computation and Language · Computer Science
Q8BERT: Quantized 8Bit BERT
Ofir Zafrir, Guy Boudoukh, Peter Izsak, Moshe Wasserblat
2021-12-20
Machine Learning · Computer Science
Towards Federated Learning with On-device Training and Communication in 8-bit Floating Point
Bokun Wang, Axel Berg, Durmus Alp Emre Acar, Chuteng Zhou
2025-07-31
Machine Learning · Computer Science
8-bit Numerical Formats for Deep Neural Networks
Badreddine Noune, Philip Jones, Daniel Justus, Dominic Masters +1
2022-06-08
Machine Learning · Computer Science
Extremely Low Bit Transformer Quantization for On-Device Neural Machine Translation
Insoo Chung, Byeongwook Kim, Yoonjung Choi, Se Jung Kwon +4
2020-10-14
Machine Learning · Computer Science
Training Deep Neural Networks with 8-bit Floating Point Numbers
Naigang Wang, Jungwook Choi, Daniel Brand, Chia-Yu Chen +1
2018-12-20
Machine Learning · Computer Science
FrameQuant: Flexible Low-Bit Quantization for Transformers
Harshavardhan Adepu, Zhanpeng Zeng, Li Zhang, Vikas Singh
2024-08-01
Computation and Language · Computer Science
Speeding Up Neural Machine Translation Decoding by Cube Pruning
Wen Zhang, Liang Huang, Yang Feng, Lei Shen +1
2018-09-11
Artificial Intelligence · Computer Science
FP8-BERT: Post-Training Quantization for Transformer
Jianwei Li, Tianchi Zhang, Ian En-Hsu Yen, Dongkuan Xu
2023-12-13
Machine Learning · Computer Science
Integer Quantization for Deep Learning Inference: Principles and Empirical Evaluation
Hao Wu, Patrick Judd, Xiaojie Zhang, Mikhail Isaev +1
2020-04-22
Computation and Language · Computer Science
Scaling Neural Machine Translation
Myle Ott, Sergey Edunov, David Grangier, Michael Auli
2018-09-06
Machine Learning · Computer Science
$\mu$nit Scaling: Simple and Scalable FP8 LLM Training
Saaketh Narayan, Abhay Gupta, Mansheej Paul, Davis Blalock
2025-06-06
Computation and Language · Computer Science
When and Why are Pre-trained Word Embeddings Useful for Neural Machine Translation?
Ye Qi, Devendra Singh Sachan, Matthieu Felix, Sarguna Janani Padmanabhan +1
2018-04-19
Computer Vision and Pattern Recognition · Computer Science
A Survey of Quantization Methods for Efficient Neural Network Inference
Amir Gholami, Sehoon Kim, Zhen Dong, Zhewei Yao +2
2021-06-23
Machine Learning · Computer Science
Towards Accurate and Efficient Sub-8-Bit Integer Training
Wenjin Guo, Donglai Liu, Weiying Xie, Yunsong Li +6
2024-11-19
Computer Vision and Pattern Recognition · Computer Science
Post-training 4-bit quantization of convolution networks for rapid-deployment
Ron Banner, Yury Nahshan, Elad Hoffer, Daniel Soudry
2019-05-30
Computation and Language · Computer Science
How Much Does Tokenization Affect Neural Machine Translation?
Miguel Domingo, Mercedes Garcıa-Martınez, Alexandre Helle, Francisco Casacuberta +1
2019-06-12