中文

Trillion-7B技术报告

计算与语言 2025-04-23 v1 人工智能 机器学习

摘要

我们介绍Trillion-7B,这是目前面向韩语中心的、最具token效率的多语言大语言模型。我们的新型跨语言文档注意力(Cross-lingual Document Attention, XLDA)机制,使其能够高效、有效地将知识从英语传递到韩语、日语等目标语言。结合优化后的数据混合、语言特定过滤和量身定制的分词器构建,Trillion-7B在仅将2T训练token中10%用于多语言数据的情况下,即可实现与竞争模型相当的性能。全量训练仅需59.4K个H100 GPU小时($148K)。在四种语言、27个基准测试上的全面评估表明,Trillion-7B在多语言性能和跨语言一致性方面表现出色。

关键词

引用

@article{arxiv.2504.15431,
  title  = {Trillion 7B Technical Report},
  author = {Sungjun Han and Juyoung Suk and Suyeong An and Hyungguk Kim and Kyuseok Kim and Wonsuk Yang and Seungtaek Choi and Jamin Shin},
  journal= {arXiv preprint arXiv:2504.15431},
  year   = {2025}
}

备注

Preview version