中文

通过字符级建模改进翻译中的语言与模态迁移

计算与语言 2025-06-02 v1

摘要

当前的翻译系统尽管具有高度的多语言能力,但仅覆盖了世界语言的 5%。将语言覆盖范围扩大到长尾的低资源语言需要依赖跨语言和跨模态知识转移的数据高效方法。为此,我们提出了一种基于字符的方法,以提高对新语言和模态的适应性。我们的方法利用了 SONAR,这是一个具有不同编码和解码模块的多语言固定大小嵌入空间。我们使用带有平行翻译数据的师生方法来获取字符级编码器。然后,使用 ASR 数据,我们训练了一个轻量级适配器,将大规模多语言 CTC ASR 模型(MMS)连接到字符级编码器,从而有可能实现 1,000 多种语言的语音翻译。在 FLORES+ 上对 75 种语言的文本翻译实验表明,我们基于字符的方法比传统的基于子词的模型能实现更好的语言迁移,特别是在低资源设置中表现优于后者,并展示了对未见语言更好的零样本泛化能力。我们的语音适应最大化了从文本模态的知识转移,在 FLEURS 基准的 33 种语言的语音到文本翻译上取得了 SOTA 结果,超越了以前的监督和级联模型,尽管它是一个带有来自 ASR 数据最小监督的零样本模型。

关键词

引用

@article{arxiv.2505.24561,
  title  = {Improving Language and Modality Transfer in Translation by Character-level Modeling},
  author = {Ioannis Tsiamas and David Dale and Marta R. Costa-jussà},
  journal= {arXiv preprint arXiv:2505.24561},
  year   = {2025}
}

备注

ACL 2025