使用去偏 heuristic 改善低资源语言网络抽取平行语料的质量
计算与语言
2025-09-23 v3
摘要
平行数据清理(PDC)技术旨在从网络抽取的语料中筛选出噪声平行句子。使用来自预训练多语言语言模型(multiPLM)得到的句子嵌入相似度对句子对进行排序是最常见的PDC技术。然而,前期研究表明,multiPLM 的选择显著影响过滤后平行语料的质量,而使用此类数据训练的神经机器翻译(NMT)模型在不同multiPLM之间表现出差异。本文指出,这种差异源于不同multiPLM对特定类型的句子对存在偏差,而从NMT的角度看,这些句子被视为噪声。我们展示,通过采用一系列 heuristic 可在一定程度上去除此类噪声平行句子。使用清理后的语料训练的NMT模型可产生更好的结果,同时缩小不同multiPLM之间的差异。我们公开发布了源代码和已清理的数据集。
引用
@article{arxiv.2502.19074,
title = {Improving the quality of Web-mined Parallel Corpora of Low-Resource Languages using Debiasing Heuristics},
author = {Aloka Fernando and Nisansa de Silva and Menan Velyuthan and Charitha Rathnayake and Surangika Ranathunga},
journal= {arXiv preprint arXiv:2502.19074},
year = {2025}
}
备注
EMNLP 2025 Camera-ready version