HilMeMe:一种关注多词表达式的人机协同机器翻译评测指标
计算与语言
2022-11-11 v1 人机交互
摘要
随着机器翻译(MT)系统的快速发展,尤其是神经机器翻译(NMT)模型带来的新推进,MT输出质量已达到新的准确水平。然而,许多研究者批评当前流行的如BLEU等评测指标无法正确区分最先进NMT系统间质量差异。在本短文中,我们描述了一个受语言学驱动、关注惯用与术语性多词表达式(MWEs)的人机协同(human-in-the-loop)评测指标的设计与实现。MWEs已成为包括MT在内的许多自然语言处理(NLP)任务中的瓶颈。通过考察不同MT系统以准确且意义等价方式识别与翻译MWEs的能力,MWEs可用作区分这些系统的主要因素之一。
引用
@article{arxiv.2211.05201,
title = {HilMeMe: A Human-in-the-Loop Machine Translation Evaluation Metric Looking into Multi-Word Expressions},
author = {Lifeng Han},
journal= {arXiv preprint arXiv:2211.05201},
year = {2022}
}
备注
arXiv admin note: text overlap with arXiv:2105.03311