中文

利用参数高效训练方法进行低资源文本分类:马拉地语案例研究

计算与语言 2024-08-07 v1 机器学习

摘要

随着低资源语言数字内容的激增,对专门针对这些语言的先进自然语言处理(NLP)技术的需求日益增长。BERT(双向编码器表示来自Transformer)作为众多NLP架构和语言模型的基础框架,正越来越多地用于低资源NLP模型的开发。参数高效微调(PEFT)是一种微调大型语言模型(LLM)并减少训练参数以降低模型训练所需计算成本、同时获得与完全微调模型相当结果的方法。在本工作中,我们对印地语低资源语言马拉地语进行了PEFT方法的研究。我们对PEFT方法应用于各种单语和多语言马拉地语BERT模型进行了全面分析。这些方法在MahaSent、MahaHate和MahaNews等著名文本分类数据集上进行了评估。引入PEFT技术被证明可以显著加快模型的训练速度,解决了模型开发和部署的关键方面。在本研究中,我们探索了大型语言模型的低秩适应(LoRA)和适配器方法用于低资源文本分类。我们表明这些方法与完全微调具有竞争力,且可以在不损失精度的情况下使用。本研究为马拉地语BERT模型的有效性提供了有价值的见解,为马拉地语及类似印地语语言NLP能力的持续进步奠定了基础。

关键词

引用

@article{arxiv.2408.03172,
  title  = {Leveraging Parameter Efficient Training Methods for Low Resource Text Classification: A Case Study in Marathi},
  author = {Pranita Deshmukh and Nikita Kulkarni and Sanhita Kulkarni and Kareena Manghani and Raviraj Joshi},
  journal= {arXiv preprint arXiv:2408.03172},
  year   = {2024}
}

备注

Accepted at I2CT 2024