Trillion-7B技术报告
计算与语言
2025-04-23 v1 人工智能
机器学习
摘要
我们介绍Trillion-7B,这是目前面向韩语中心的、最具token效率的多语言大语言模型。我们的新型跨语言文档注意力(Cross-lingual Document Attention, XLDA)机制,使其能够高效、有效地将知识从英语传递到韩语、日语等目标语言。结合优化后的数据混合、语言特定过滤和量身定制的分词器构建,Trillion-7B在仅将2T训练token中10%用于多语言数据的情况下,即可实现与竞争模型相当的性能。全量训练仅需59.4K个H100 GPU小时($148K)。在四种语言、27个基准测试上的全面评估表明,Trillion-7B在多语言性能和跨语言一致性方面表现出色。
引用
@article{arxiv.2504.15431,
title = {Trillion 7B Technical Report},
author = {Sungjun Han and Juyoung Suk and Suyeong An and Hyungguk Kim and Kyuseok Kim and Wonsuk Yang and Seungtaek Choi and Jamin Shin},
journal= {arXiv preprint arXiv:2504.15431},
year = {2025}
}
备注
Preview version