中文

xSIM++:一种面向低资源语言双语文本挖掘性能的改进代理指标

计算与语言 2023-06-23 v1

摘要

我们提出了一种基于多语言嵌入空间中相似度来评估双语文本挖掘的新代理分数:xSIM++。与 xSIM 相比,这一改进代理利用基于规则的方法,用合成的、难以区分的示例来扩展任意评估集中的英语句子,这些示例更贴近我们在大规模挖掘过程中遇到的场景。我们通过针对一组低资源语言运行大量双语文本挖掘实验,并随后在挖掘得到的数据上训练 NMT 系统,来验证该代理。与 xSIM 相比,我们表明 xSIM++ 与在挖掘双语文本上训练的翻译系统的下游 BLEU 分数具有更好的相关性,从而提供了一种无需运行昂贵的双语文本挖掘流水线即可可靠评估挖掘性能的代理。xSIM++ 还报告了不同错误类型的性能,为模型开发提供更细粒度的反馈。

关键词

引用

@article{arxiv.2306.12907,
  title  = {xSIM++: An Improved Proxy to Bitext Mining Performance for Low-Resource Languages},
  author = {Mingda Chen and Kevin Heffernan and Onur Çelebi and Alex Mourachko and Holger Schwenk},
  journal= {arXiv preprint arXiv:2306.12907},
  year   = {2023}
}

备注

The first two authors contributed equally; ACL 2023 short; Code and data are available at https://github.com/facebookresearch/LASER