Distributed, Parallel, and Cluster Computing · Computer Science
The Convergence of Stochastic Gradient Descent in Asynchronous Shared Memory
Dan Alistarh, Christopher De Sa, Nikola Konstantinov
2018-06-25
Distributed, Parallel, and Cluster Computing · Computer Science
Asynchronous Parallel Stochastic Gradient Descent - A Numeric Core for Scalable Distributed Machine Learning Algorithms
Janis Keuper, Franz-Josef Pfreundt
2015-10-06
Distributed, Parallel, and Cluster Computing · Computer Science
Communication-Efficient, 2D Parallel Stochastic Gradient Descent for Distributed-Memory Optimization
Aditya Devarakonda, Ramakrishnan Kannan
2025-01-14
Machine Learning · Statistics
Stochastic Normalized Gradient Descent with Momentum for Large-Batch Training
Shen-Yi Zhao, Chang-Wei Shi, Yin-Peng Xie, Wu-Jun Li
2024-04-16
Distributed, Parallel, and Cluster Computing · Computer Science
Performance Optimization on Model Synchronization in Parallel Stochastic Gradient Descent Based SVM
Vibhatha Abeykoon, Geoffrey Fox, Minje Kim
2019-05-06
Machine Learning · Computer Science
Soft Merging: A Flexible and Robust Soft Model Merging Approach for Enhanced Neural Network Performance
Hao Chen, Yusen Wu, Phuong Nguyen, Chao Liu +1
2023-09-22
Machine Learning · Computer Science
Fast Bounded Online Gradient Descent Algorithms for Scalable Kernel-Based Online Learning
Peilin Zhao, Jialei Wang, Pengcheng Wu, Rong Jin +1
2012-06-22
Machine Learning · Computer Science
Variance Reduced Stochastic Gradient Descent with Neighbors
Thomas Hofmann, Aurelien Lucchi, Simon Lacoste-Julien, Brian McWilliams
2016-02-29
Machine Learning · Computer Science
Asynchronous Local-SGD Training for Language Modeling
Bo Liu, Rachita Chhaparia, Arthur Douillard, Satyen Kale +4
2024-09-24
Computation and Language · Computer Science
Accelerating Asynchronous Stochastic Gradient Descent for Neural Machine Translation
Nikolay Bogoychev, Marcin Junczys-Dowmunt, Kenneth Heafield, Alham Fikri Aji
2018-09-17
Machine Learning · Computer Science
OD-SGD: One-step Delay Stochastic Gradient Descent for Distributed Training
Yemao Xu, Dezun Dong, Weixia Xu, Xiangke Liao
2020-05-15
Machine Learning · Computer Science
Layered SGD: A Decentralized and Synchronous SGD Algorithm for Scalable Deep Neural Network Training
Kwangmin Yu, Thomas Flynn, Shinjae Yoo, Nicholas D'Imperio
2019-06-17