中文

基于跨语言句子表示的提升低资源机器翻译的数据选择方法

计算与语言 2024-09-05 v1 机器学习

摘要

低资源语言对的机器翻译因平行语料和语言资源的稀缺而面临重大挑战。本研究聚焦于英语-马拉里语言对的案例,现有数据集存在显著噪声,致使机器翻译模型性能受限。为缓解数据质量问题的影响,我们提出一种基于跨语言句子表示的数据过滤方法。该方法性地利用多语言SBERT模型过滤训练数据中的有问题翻译。具体而言,我们采用IndicSBERT相似度模型评估原句与译文之间的语义等效性,从而保留语言上正确的翻译,同时剔除显著偏差的实例。结果表明,与基于IndicSBERT的后过滤方法相比,我们的方法在翻译质量上实现了显著提升。这一研究表明,跨语言句子表示可减少机器翻译场景中因资源有限而产生的错误。通过将多语言句子BERT模型集成到翻译管道中,该研究为低资源环境下的机器翻译技术提供了有价值的框架。该方法不仅解决了英语-马拉里语言对的挑战,也为提升其他低资源语言翻译任务中的翻译质量提供了可推广的框架。

关键词

引用

@article{arxiv.2409.02712,
  title  = {A Data Selection Approach for Enhancing Low Resource Machine Translation Using Cross-Lingual Sentence Representations},
  author = {Nidhi Kowtal and Tejas Deshpande and Raviraj Joshi},
  journal= {arXiv preprint arXiv:2409.02712},
  year   = {2024}
}

备注

Accepted at I2CT 2024