Tucano 2 Cool:更好的开源葡萄牴语言大模型
计算与语言
2026-03-05 v1 人工智能
摘要
我们提出了 Tucano 2,一个完全开放的大型语言模型(LLM)套件,包含 0.5-3.7 billion 参数,旨在解决葡萄牴语开源 LLM 开发中存在的某些差距。遵循我们的前期工作,我们将数据集 GigaVerbo-v2 扩展到新的质量和规模,同时引入新的合成数据集 GigaVerbo-v2 Synth,旨在填补 GigaVerbo-v2 中存在的缺失差距,以及两个 post-training 数据集 GigaVerbo-v2 SFT 和 GigaVerbo-v2 Preferences,使葡萄牴语 LLM 可在诸如检索增强生成、编码、工具使用、链条思考推理等多个感兴趣领域进行训练。通过大量消融研究,我们设计了 Tucano 2 套件(Base、Instruct 和 Think)的 pretraining 和 continual pretraining 配方,这些配方在多个葡萄牴语言建模基准测试中实现了最先进的性能。我们还扩展和细化了我们早期工作中引入的评估 harness,产生一个综合的评估套件,提供强信号跨不同的 pretraining、continual pretraining 和 post-training 方案。Tucano 2 的所有工件都公开释放,包括训练配方、日志和源代码,确保我们的工作是可重复的、可访问的,并可由更广泛的葡萄牴 NLP 社区扩展和改进。
引用
@article{arxiv.2603.03543,
title = {Tucano 2 Cool: Better Open Source LLMs for Portuguese},
author = {Nicholas Kluge Corrêa and Aniket Sen and Shiza Fatimah and Sophia Falk and Lennard Landgraf and Julia Kastner and Lucie Flek},
journal= {arXiv preprint arXiv:2603.03543},
year = {2026}
}