中文

TextGram:迈向更好的领域自适应预训练

计算与语言 2024-04-30 v1 机器学习

摘要

对于绿色 AI,测量和减少训练大型语言模型过程中产生的碳足迹至关重要。在 NLP 中,对 Transformer 模型进行预训练需要大量的计算资源。这种预训练涉及使用大量文本数据来获取先验知识,以执行下游任务。因此,重要的是我们从这庞大的语料库中选择正确的数据,即领域特定数据,以实现与我们领域特定任务相符的最佳结果。虽然在大型无监督数据上训练成本高昂,但可以通过在预训练前执行数据选择步骤来优化。选择重要数据可以减少空间开销和预训练模型所需的大量时间,同时保持恒定的准确度。我们研究了现有的选择策略,并提出了我们自己的领域自适应数据选择方法——TextGram——它能有效地从大型语料库中选择必要的数据。我们比较并评估了在文本分类任务上,经过微调的模型在使用和不使用数据选择情况下的结果。我们表明,与其他选择方法相比,所提出的策略效果更好。

关键词

引用

@article{arxiv.2404.18228,
  title  = {TextGram: Towards a better domain-adaptive pretraining},
  author = {Sharayu Hiwarkhedkar and Saloni Mittal and Vidula Magdum and Omkar Dhekane and Raviraj Joshi and Geetanjali Kale and Arnav Ladkat},
  journal= {arXiv preprint arXiv:2404.18228},
  year   = {2024}
}

备注

Accepted at SPELLL 2023