中文

VinaLLaMA:基于 LLaMA 的越南语基础模型

计算与语言 2023-12-19 v1

摘要

在本技术报告中,我们介绍了 VinaLLaMA,这是一种面向越南语的开源权重、最先进 (SOTA) 大语言模型,构建于 LLaMA-2 之上并额外使用了 8000 亿个训练 token。VinaLLaMA 不仅展现出流利的越南语能力,还体现了对越南文化的深刻理解,使其成为真正的本土化模型。VinaLLaMA-7B-chat 在 100 万个高质量合成样本上训练,在 VLSP、VMLU 和 Vicuna Benchmark Vietnamese 等关键基准测试中取得了 SOTA 结果,标志着越南人工智能领域的重大进步,并为各种应用提供了多功能资源。

关键词

引用

@article{arxiv.2312.11011,
  title  = {VinaLLaMA: LLaMA-based Vietnamese Foundation Model},
  author = {Quan Nguyen and Huy Pham and Dung Dao},
  journal= {arXiv preprint arXiv:2312.11011},
  year   = {2023}
}

备注

VinaLLaMA Technical Report - 13 pages