中文

机器翻译中代词回指评估:一种评测指标与一套测试集

计算与语言 2019-09-04 v1 人工智能 机器学习

摘要

机器翻译中持续进行的神经革命使得建模句级以上的更大上下文更为容易,这有潜力帮助解决某些语篇级歧义(如代词回指),从而实现更好的翻译。遗憾的是,即使由此带来的改进被人类视为实质性,传统自动评测指标如BLEU几乎无法察觉,因为仅少数词最终受影响。因此,需要专门的评测指标。为此,我们贡献了一个广泛的针对性数据集,可用作代词翻译的测试集,涵盖多种源语言以及取自真实系统翻译、面向英语的不同代词错误。我们进一步提出一种评测指标以区分好坏代词翻译。我们还开展了用户研究以报告与人类判断的相关性。

关键词

引用

@article{arxiv.1909.00131,
  title  = {Evaluating Pronominal Anaphora in Machine Translation: An Evaluation Measure and a Test Suite},
  author = {Prathyusha Jwalapuram and Shafiq Joty and Irina Temnikova and Preslav Nakov},
  journal= {arXiv preprint arXiv:1909.00131},
  year   = {2019}
}

备注

Accepted at EMNLP 2019