中文

使用去偏 heuristic 改善低资源语言网络抽取平行语料的质量

计算与语言 2025-09-23 v3

摘要

平行数据清理(PDC)技术旨在从网络抽取的语料中筛选出噪声平行句子。使用来自预训练多语言语言模型(multiPLM)得到的句子嵌入相似度对句子对进行排序是最常见的PDC技术。然而,前期研究表明,multiPLM 的选择显著影响过滤后平行语料的质量,而使用此类数据训练的神经机器翻译(NMT)模型在不同multiPLM之间表现出差异。本文指出,这种差异源于不同multiPLM对特定类型的句子对存在偏差,而从NMT的角度看,这些句子被视为噪声。我们展示,通过采用一系列 heuristic 可在一定程度上去除此类噪声平行句子。使用清理后的语料训练的NMT模型可产生更好的结果,同时缩小不同multiPLM之间的差异。我们公开发布了源代码和已清理的数据集。

关键词

引用

@article{arxiv.2502.19074,
  title  = {Improving the quality of Web-mined Parallel Corpora of Low-Resource Languages using Debiasing Heuristics},
  author = {Aloka Fernando and Nisansa de Silva and Menan Velyuthan and Charitha Rathnayake and Surangika Ranathunga},
  journal= {arXiv preprint arXiv:2502.19074},
  year   = {2025}
}

备注

EMNLP 2025 Camera-ready version