中文

Cabrita:缩小外语模型的差距

计算与语言 2023-08-24 v1 人工智能 机器学习

摘要

在特定语言或领域从头训练模型的策略有两个重要目的:i)提升在特定语言或领域语境中的性能,以及ii)确保有效的分词。这种方法的主要局限在于相关成本,根据模型规模和涉及的参数量,可能达到六到七位数美元。克服成本挑战的主要解决方案是依赖可用的预训练模型,尽管近期有LLaMA和LLaMA-2等进展,这些模型在某些特定领域问题中仍显低效,或在涉及对话记忆资源的场景中因表示文本所需词元数量庞大而无效。为克服此问题,我们提出一种名为Cabrita的方法,我们的研究表明其以可承受的成本成功解决了性能和高效分词问题。我们相信该方法可应用于任何类Transformer架构模型。为验证研究,我们使用葡萄牙语文本对名为OpenLLaMA的30亿参数模型进行连续预训练,得到名为openCabrita 3B的模型。openCabrita 3B还具有新分词器,显著减少了表示文本所需的词元数量。在我们的评估中,对于少样本学习任务,该3B模型与传统连续预训练方法以及7B英文预训练模型取得了相似结果。

关键词

引用

@article{arxiv.2308.11878,
  title  = {Cabrita: closing the gap for foreign languages},
  author = {Celio Larcher and Marcos Piau and Paulo Finardi and Pedro Gengo and Piero Esposito and Vinicius Caridá},
  journal= {arXiv preprint arXiv:2308.11878},
  year   = {2023}
}

备注

9 pages, 1 figure