LLaMAntino:用于意大利语有效文本生成的 LLaMA 2 模型
计算与语言
2023-12-18 v1
摘要
大型语言模型代表了最先进的语言模型,旨在赋予计算机理解自然语言的能力。凭借其捕获复杂上下文关系的卓越能力,LLaMA (Large Language Model Meta AI) 系列通过发布基础模型代表了自然语言处理领域的一项新进展,这些基础模型旨在凭借其大量可训练参数(70亿、130亿和700亿参数)提升 Transformer 架构的自然语言理解能力。在许多自然语言理解任务中,这些模型获得了与 OpenAI Chat-GPT 等私营公司模型相同的性能,并具有公开权重和代码以供研究和商业使用的优势。在本工作中,我们研究了 LLaMA 模型语言适应的可能性,明确聚焦于解决意大利语覆盖的挑战。采用开放科学的方法,我们探索了各种微调方法,以确保生成适合该原始模型数据集中代表性不足语言常见任务的高质量意大利语文本。我们的目标是发布具有强语言特性的有效文本生成模型,以应对使用多语言或通用 LLM 似乎具有挑战性的许多任务。通过秉持开放科学理念,本研究通过引入全新的意大利语 LLM 家族 LLaMAntino,为意大利语的语言适应策略做出了贡献。
引用
@article{arxiv.2312.09993,
title = {LLaMAntino: LLaMA 2 Models for Effective Text Generation in Italian Language},
author = {Pierpaolo Basile and Elio Musacchio and Marco Polignano and Lucia Siciliani and Giuseppe Fiameni and Giovanni Semeraro},
journal= {arXiv preprint arXiv:2312.09993},
year = {2023}
}