中文

BLEU、METEOR、BERTScore:评估指标在评估情感导向文本中严重翻译错误时的性能

计算与语言 2021-09-30 v1

摘要

社交媒体公司及相关部门广泛使用人工智能 (AI) 工具来监控仇恨言论、暴力颂扬或亵渎内容的帖子。由于 AI 软件需要海量数据来训练计算机,因此通常使用在线内容的机器翻译 (MT) 来处理以多种语言撰写的帖子,从而增加训练所需的数据。然而,在翻译情感导向的用户生成内容 (UGC) 时,MT 错误经常发生,当涉及低资源语言时尤为如此。整个过程的充分性依赖于这样一个假设:所使用的评估指标能可靠地指示翻译质量。在本文中,我们评估了自动质量指标检测严重机器翻译错误的能力,这些错误可能导致对情感信息的严重误解。我们比较了三种经典指标在无意义翻译(语义内容严重受损)与存在严重错误(仅扭曲源文本情感)的有意义翻译上的性能。我们得出结论,需要对自动指标进行微调,使其在检测情感严重错误时更加稳健。

关键词

引用

@article{arxiv.2109.14250,
  title  = {BLEU, METEOR, BERTScore: Evaluation of Metrics Performance in Assessing Critical Translation Errors in Sentiment-oriented Text},
  author = {Hadeel Saadany and Constantin Orasan},
  journal= {arXiv preprint arXiv:2109.14250},
  year   = {2021}
}

备注

Accepted for TRITON (TRanslation and Interpreting Technology ONline) 2021