OneAligner:利用一对富资源语言对实现低资源句子检索的零样本跨语言迁移
计算与语言
2022-05-19 v1 人工智能
机器学习
摘要
在多语言语料库中对齐平行句子对于为机器翻译等下游应用整理数据至关重要。在本工作中,我们提出 OneAligner,一种专为句子检索任务设计的对齐模型。该模型仅需在单一语言对上训练,并以跨语言方式迁移至低资源语言对,性能下降可忽略不计。当使用大规模平行多语言语料库(OPUS-100)的所有语言对训练时,该模型在 Tateoba 数据集上取得了最先进(state-of-the-art)结果,在以不到其 0.6% 的平行数据下,准确率超越同等规模的先前模型 8.0 个百分点。当在单一富资源语言对(无论是否以英语为中心)上微调时,我们的模型能够在相同数据预算下匹配在所有语言对上微调的模型性能,准确率下降小于 2.0 个百分点。此外,在相同设置下,增加富资源语言对的数量可单调提升性能,准确率差异最小可达 0.4 个百分点,从而降低了收集任何低资源平行数据的必要性。最后,我们通过实证结果与分析得出结论:句子对齐任务的性能主要取决于单语和平行数据规模(直至某一规模阈值),而非取决于用于训练或评估的语言对。
引用
@article{arxiv.2205.08605,
title = {OneAligner: Zero-shot Cross-lingual Transfer with One Rich-Resource Language Pair for Low-Resource Sentence Retrieval},
author = {Tong Niu and Kazuma Hashimoto and Yingbo Zhou and Caiming Xiong},
journal= {arXiv preprint arXiv:2205.08605},
year = {2022}
}
备注
Accepted to Findings of ACL 2022