基于对比学习的低资源语言双语文本挖掘
计算与语言
2022-08-25 v1
摘要
为低资源语言挖掘高质量双语文本具有挑战性。本文表明,使用多负排序损失(一种对比目标)微调的语言模型的句子表示有助于检索干净的双语文本。实验表明,从我们的方法挖掘出的平行数据在低资源语言高棉语和普什图语上显著优于先前的最先进方法。
引用
@article{arxiv.2208.11194,
title = {Bitext Mining for Low-Resource Languages via Contrastive Learning},
author = {Weiting Tan and Philipp Koehn},
journal= {arXiv preprint arXiv:2208.11194},
year = {2022}
}