中文

IKUN for WMT24 General MT Task: LLMs Are here for Multilingual Machine Translation

计算与语言 2024-08-30 v2

摘要

本文介绍两个用于WMT24通用机器翻译任务的多语言系统IKUN和IKUN-C。IKUN和IKUN-C分别代表开放式系统和受限式系统,基于Llama-3-8b和Mistral-7B-v0.3构建。两者均设计用于单一模型处理全部11种语言方向。根据自动评估指标,IKUN-C在所有受限系统中获得1个第一名和3个第二名成绩,而IKUN在开放及受限系统中分别获得1个第一名和2个第二名成绩。这些鼓舞人心的结果表明,大型语言模型(LLM)正逼近有效多语言机器翻译所需的水平。系统基于两阶段方法:首先在10种语言的单语数据上进行连续预训练,随后在11种语言方向的高质量平行数据上进行微调。IKUN与IKUN-C的主要区别在于其单语预训练策略。IKUN-C使用受限单语数据进行预训练,而IKUN则利用OSCAR数据集中的单语数据。在第二阶段,两者均在来自NTREX、Flores和WMT16-23的平行数据上进行微调,以覆盖所有11种语言对。

关键词

引用

@article{arxiv.2408.11512,
  title  = {IKUN for WMT24 General MT Task: LLMs Are here for Multilingual Machine Translation},
  author = {Baohao Liao and Christian Herold and Shahram Khadivi and Christof Monz},
  journal= {arXiv preprint arXiv:2408.11512},
  year   = {2024}
}

备注

typo: 120K -> 12K vocabulary size