100个样本能走多远?通过微型多平行数据解锁整体零样本多语言翻译
计算与语言
2024-03-03 v2 机器学习
摘要
零样本翻译旨在多语言机器翻译(MMT)中翻译训练期间未见过的语言对,这在很大程度上被认为是一个开放性问题。一种常见但耗费资源的解决方案是向训练语料库中添加尽可能多的相关翻译方向。在本文中,我们表明,对于一个以英语为中心的模型,只需使用极少量的多平行数据进行微调,就能实现令人惊讶的巨大零样本改进。例如,在EC30数据集上,我们仅使用100个多平行样本,就在保持以英语为中心的翻译质量的同时,获得了高达+21.7 ChrF的非英语整体改进(870个方向)。在研究微调数据的大小效应及其迁移能力时,我们发现,一个小的、随机采样的微调方向集就足以实现可比的改进。由此产生的非英语性能接近完整的翻译上限。即使在最简设置下——仅用一个样本进行微调——众所周知的偏离目标问题也几乎完全得到解决,这解释了所观察到的翻译质量改进的部分——但不是全部——原因。
引用
@article{arxiv.2401.12413,
title = {How Far Can 100 Samples Go? Unlocking Overall Zero-Shot Multilingual Translation via Tiny Multi-Parallel Data},
author = {Di Wu and Shaomu Tan and Yan Meng and David Stap and Christof Monz},
journal= {arXiv preprint arXiv:2401.12413},
year = {2024}
}
备注
15 pages, 5 figures