Distributed, Parallel, and Cluster Computing · Computer Science
GPU Memory and Utilization Estimation for Training-Aware Resource Management: Opportunities and Limitations
Ehsan Yousefzadeh-Asl-Miandoab, Reza Karimzadeh, Danyal Yorulmaz, Bulat Ibragimov +1
2026-04-29
Machine Learning · Computer Science
A Study of Optimizations for Fine-tuning Large Language Models
Arjun Singh, Nikhil Pandey, Anup Shirgaonkar, Pavan Manoj +1
2024-06-07
Distributed, Parallel, and Cluster Computing · Computer Science
Insights into DeepSeek-V3: Scaling Challenges and Reflections on Hardware for AI Architectures
Chenggang Zhao, Chengqi Deng, Chong Ruan, Damai Dai +11
2025-12-24
Hardware Architecture · Computer Science
Understanding Training Efficiency of Deep Learning Recommendation Models at Scale
Bilge Acun, Matthew Murphy, Xiaodong Wang, Jade Nie +2
2020-11-12
Machine Learning · Computer Science
Estimating Deep Learning energy consumption based on model architecture and training environment
Santiago del Rey, Luís Cruz, Xavier Franch, Silverio Martínez-Fernández
2025-09-26
Distributed, Parallel, and Cluster Computing · Computer Science
Efficient Memory Management for GPU-based Deep Learning Systems
Junzhe Zhang, Sai Ho Yeung, Yao Shu, Bingsheng He +1
2019-03-18
Computation and Language · Computer Science
DeepSeek-V3 Technical Report
DeepSeek-AI, Aixin Liu, Bei Feng, Bing Xue +196
2025-02-19
Machine Learning · Computer Science
Performance Analysis and Characterization of Training Deep Learning Models on Mobile Devices
Jie Liu, Jiawen Liu, Wan Du, Dong Li
2019-09-10
Machine Learning · Computer Science
Deep Learning Models on CPUs: A Methodology for Efficient Training
Quchen Fu, Ramesh Chukka, Keith Achorn, Thomas Atta-fosu +4
2023-06-21
Performance · Computer Science
Pinpointing the Memory Behaviors of DNN Training
Jiansong Li, Xiao Dong, Guangli Li, Peng Zhao +8
2021-04-02
Distributed, Parallel, and Cluster Computing · Computer Science
DeepCompile: A Compiler-Driven Approach to Optimizing Distributed Deep Learning Training
Masahiro Tanaka, Du Li, Umesh Chand, Ali Zafar +2
2026-02-20
Distributed, Parallel, and Cluster Computing · Computer Science
Breaking the Memory Wall: A Study of I/O Patterns and GPU Memory Utilization for Hybrid CPU-GPU Offloaded Optimizers
Avinash Maurya, Jie Ye, M. Mustafa Rafique, Franck Cappello +1
2024-06-18
Machine Learning · Computer Science
Low-Memory Neural Network Training: A Technical Report
Nimit S. Sohoni, Christopher R. Aberger, Megan Leszczynski, Jian Zhang +1
2022-04-12
Distributed, Parallel, and Cluster Computing · Computer Science
Scaling Studies for Efficient Parameter Search and Parallelism for Large Language Model Pre-training
Michael Benington, Leo Phan, Chris Pierre Paul, Evan Shoemaker +4
2023-10-12
Machine Learning · Computer Science
Benchmarking Resource Usage for Efficient Distributed Deep Learning
Nathan C. Frey, Baolin Li, Joseph McDonald, Dan Zhao +5
2022-02-01
Distributed, Parallel, and Cluster Computing · Computer Science
ZeRO-Infinity: Breaking the GPU Memory Wall for Extreme Scale Deep Learning
Samyam Rajbhandari, Olatunji Ruwase, Jeff Rasley, Shaden Smith +1
2021-04-19
Artificial Intelligence · Computer Science
LLMem: Estimating GPU Memory Usage for Fine-Tuning Pre-Trained LLMs
Taeho Kim, Yanming Wang, Vatshank Chaturvedi, Lokesh Gupta +3
2024-04-18
Distributed, Parallel, and Cluster Computing · Computer Science
Distributed Training Large-Scale Deep Architectures
Shang-Xuan Zou, Chun-Yen Chen, Jui-Lin Wu, Chun-Nan Chou +5
2017-09-21
Machine Learning · Computer Science
Energy Consumption in Parallel Neural Network Training
Philipp Huber, David Li, Juan Pedro Gutiérrez Hermosillo Muriedas, Deifilia Kieckhefen +3
2025-08-12
Distributed, Parallel, and Cluster Computing · Computer Science
SuperNeurons: Dynamic GPU Memory Management for Training Deep Neural Networks
Linnan Wang, Jinmian Ye, Yiyang Zhao, Wei Wu +4
2018-01-17
Distributed, Parallel, and Cluster Computing · Computer Science
Optimizing High-Throughput Distributed Data Pipelines for Reproducible Deep Learning at Scale
Kashish Mittal, Di Yu, Roozbeh Ketabi, Arushi Arora +2
2026-04-24