Lingua Custodi 在 WMT 2025 术语共享任务中的参赛报告
计算与语言
2025-10-21 v1
摘要
虽然 BERT 是学习单语言句子嵌入用于语义相似性和基于嵌入的迁移学习的有效方法,但基于 BERT 的跨语言句子嵌入尚未得到探索。我们系统性地研究了学习多语言句子嵌入的方法,通过结合学习单语言和跨语言表示的最佳方法,包括:掩码语言建模(MLM)、翻译语言建模(TLM)、双编码器翻译排序和加法余弦 softmax。我们表明,引入预训练的多语言语言模型可显著减少实现良好性能所需的平行训练数据,降低约 80%。将上述方法的最佳组合产出的模型在 Tatoeba 上的双向检索准确率达 83.7%,远高于 LASER 的 65.5%,同时在单语言迁移学习基准上仍表现出竞争力。我们从 CommonCrawl 中使用最佳模型挖掘的平行数据可用于训练 en-zh 和 en-de 的竞争性 NMT 模型。我们公开发布我们的顶级多语言句子嵌入模型,支持 109+ 种语言,地址为 https://tfhub.dev/google/LaBSE。
引用
@article{arxiv.2510.17504,
title = {Lingua Custodi's participation at the WMT 2025 Terminology shared task},
author = {Jingshu Liu and Raheel Qader and Gaëtan Caillaut and Mariam Nakhlé},
journal= {arXiv preprint arXiv:2510.17504},
year = {2025}
}