中文

从 SALAMANDRA 到 SALAMANDRATA:BSC 提交 WMT25 通用机器翻译共享任务

计算与语言 2025-08-19 v1

摘要

在本文中,我们提出 SALAMANDRATA 模型族,作为 SALAMANDRA LLMs(Gonzalez-Agirre 等人,2025)的改进版本,专门针对 38 种欧洲语言的翻译相关任务进行训练。SALAMANDRATA 包含两种规模:2B 和 7B 参数。两个版本均采用相同的训练方案,第一步为基于平行数据的持续预训练,第二步为基于高质量指令的监督微调。BSC 对 WMT25 通用机器翻译共享任务的提交基于 SALAMANDRATA 的 7B 变体。我们首先调整模型词汇表以支持该任务中包含的额外非欧洲语言。随后进行了精心设计的第二阶段持续预训练与监督微调,以优化今年共享任务中所有翻译方向的性能。在解码方面,我们采用了两种质量感知策略:最小贝叶斯风险解码(Minimum Bayes Risk Decoding)以及分别基于 COMET 和 COMET-KIWI 的调优重排序(Tuned Re-ranking)。我们在 Hugging Face 上公开发布了 SALAMANDRATA 的 2B 和 7B 两个版本,以及较新的 SALAMANDRATA-V2 模型。

关键词

引用

@article{arxiv.2508.12774,
  title  = {From SALAMANDRA to SALAMANDRATA: BSC Submission for WMT25 General Machine Translation Shared Task},
  author = {Javier Garcia Gilabert and Xixian Liao and Severino Da Dalt and Ella Bohman and Audrey Mash and Francesca De Luca Fornaciari and Irene Baucells and Joan Llop and Miguel Claramunt Argote and Carlos Escolano and Maite Melero},
  journal= {arXiv preprint arXiv:2508.12774},
  year   = {2025}
}