中文

Bode:面向葡萄牙语提示任务的微调大型语言模型

计算与语言 2024-01-08 v1

摘要

大型语言模型(LLM)日益推动着自然语言处理的进步。然而,对于在各种 NLP 任务数据集中缺乏广泛代表性的低资源语言,或现有数据集规模不够大的语言(如葡萄牙语),虽然已经从 LLM 中获得了一些益处,但程度并不相同。在多语言数据集上训练的 LLM 通常难以令人满意地响应葡萄牙语提示,例如在回复中出现语码转换。本工作提出了一个基于 LLaMA 2 的葡萄牙语提示微调模型,命名为 Bode,包含两个版本:7B 和 13B。我们使用带有上下文学习的零样本方法评估了该模型在分类任务中的性能,并将其与其他 LLM 进行了比较。我们的主要贡献是提供一个在葡萄牙语上取得令人满意结果的 LLM,并提供一个可免费用于研究或商业目的的模型。

关键词

引用

@article{arxiv.2401.02909,
  title  = {Introducing Bode: A Fine-Tuned Large Language Model for Portuguese Prompt-Based Task},
  author = {Gabriel Lino Garcia and Pedro Henrique Paiola and Luis Henrique Morelli and Giovani Candido and Arnaldo Cândido Júnior and Danilo Samuel Jodas and Luis C. S. Afonso and Ivan Rizzo Guilherme and Bruno Elias Penteado and João Paulo Papa},
  journal= {arXiv preprint arXiv:2401.02909},
  year   = {2024}
}

备注

10 pages, 3 figures