中文

面向单 GPU 训练的基于 Transformer 的机器翻译模型优化:超参数消融研究

计算与语言 2023-08-14 v1 人工智能

摘要

在机器翻译任务中,模型复杂度与性能之间的关系常被假定为线性,这推动了参数数量的增加以及对多 GPU 等计算资源的相应需求。为探究这一假设,本研究利用单块 NVIDIA A100 GPU,通过在一个序列到序列机器翻译流程上进行消融,系统性地考察了超参数的影响。与预期相反,我们的实验表明参数最多的组合未必最有效。这一意外发现促使我们谨慎地缩减参数规模,从而找到了能够在单 GPU 上训练复杂模型而不牺牲翻译质量的“甜点区”。研究结果揭示了超参数选择、模型规模与计算资源需求之间的复杂关系。本研究的见解有助于持续推进机器翻译的可及性与成本效益,强调了精确超参数调优而非单纯规模扩张的重要性。

关键词

引用

@article{arxiv.2308.06017,
  title  = {Optimizing transformer-based machine translation model for single GPU training: a hyperparameter ablation study},
  author = {Luv Verma and Ketaki N. Kolhatkar},
  journal= {arXiv preprint arXiv:2308.06017},
  year   = {2023}
}

备注

12 pages, 15 figures, 1 Table