中文

在时间和内存受限的 GPU 服务上应对繁重长文本分类的 Transformer 简易技巧

计算与语言 2024-03-20 v1 人工智能

摘要

许多 NLP 研究人员依赖免费的算力服务(如 Google Colab)来微调他们的 Transformer 模型,这导致长文本分类中的超参数优化(HPO)受到限制,因为该方法具有二次复杂度且需要更多资源。在印尼语中,使用 Transformer 进行长文本分类的研究很少。大多数仅使用少量数据且未报告任何 HPO。在本研究中,我们使用 18k 篇新闻文章,基于分词器的输出长度研究了推荐使用哪些预训练模型。然后,我们比较了一些缩短和丰富序列的技巧,即去除停用词、标点符号、低频词和重复词。为了公平比较,我们提出并运行了一个高效且动态的 HPO 流程,该流程可在有限资源上逐步完成,且不需要长时间运行的优化库。利用找到的最佳技巧,我们随后比较了 512、256 和 128 个 token 的长度。我们发现,去除停用词同时保留标点符号和低频词是最佳技巧。我们的一些设置通过使用更小的 128 或 256 个首 token 成功超越了取 512 个首 token 的性能,这些更小的序列能够表示相同的信息,同时需要更少的计算资源。这些发现可以帮助开发者在有限资源下高效地追求模型的最优性能。

关键词

引用

@article{arxiv.2403.12563,
  title  = {Simple Hack for Transformers against Heavy Long-Text Classification on a Time- and Memory-Limited GPU Service},
  author = {Mirza Alim Mutasodirin and Radityo Eko Prasojo and Achmad F. Abka and Hanif Rasyidi},
  journal= {arXiv preprint arXiv:2403.12563},
  year   = {2024}
}

备注

The 10th International Conference on Advanced Informatics: Concepts, Theory, and Applications (ICAICTA 2023)