中文

神经表意文字翻译中的数据污染:可复现性研究

计算与语言 2026-05-11 v1

摘要

古老和濒危语言是 NLP 的独特挑战:其数据集天然稀缺、难以扩充、由公式化语料构建——这使得数据质量问题尤为重要且极少被审计。为了理解当前 NMT 对此类语言能实现的实际水平,我们调查了 hieroglyphic-to-German 翻译,近期研究报告使用微调的 M2M-100 可达 61.5 BLEU。我们的复现仅得 37.0 BLEU。调查这一差距,我们发现 2% 的测试目标在训练中完全相同(16/50;在 70% 阈值下 50% 以下 8-gram 重合)。这种污染显著夸大了得分:受污染的样本在五个模型配置跨两种架构下的最高 BLEU 可达 83.8 / COMET-22 0.924,而干净样本为 30.9--39.2 BLEU / COMET-22 0.622--0.676。文档级去污染仅将受污染的 BLEU 降低 4.6 分,因为 8/16 个目标通过其他源文档仍然存在——需要目标级去重。我们发布了一套去污染的 34 样本测试集并确立纠正的基线(30.9--39.2 BLEU),为该语言的神经机器翻译能力提供了现实的评估。

关键词

引用

@article{arxiv.2605.07453,
  title  = {Data Contamination in Neural Hieroglyphic Translation: A Reproducibility Study},
  author = {Ammar Toutou and Abdelrahman Harb and Christine Basta},
  journal= {arXiv preprint arXiv:2605.07453},
  year   = {2026}
}

备注

Accepted to NLP4DH 2026 Conference