BLEU、METEOR、BERTScore:评估指标在评估情感导向文本中严重翻译错误时的性能
计算与语言
2021-09-30 v1
摘要
社交媒体公司及相关部门广泛使用人工智能 (AI) 工具来监控仇恨言论、暴力颂扬或亵渎内容的帖子。由于 AI 软件需要海量数据来训练计算机,因此通常使用在线内容的机器翻译 (MT) 来处理以多种语言撰写的帖子,从而增加训练所需的数据。然而,在翻译情感导向的用户生成内容 (UGC) 时,MT 错误经常发生,当涉及低资源语言时尤为如此。整个过程的充分性依赖于这样一个假设:所使用的评估指标能可靠地指示翻译质量。在本文中,我们评估了自动质量指标检测严重机器翻译错误的能力,这些错误可能导致对情感信息的严重误解。我们比较了三种经典指标在无意义翻译(语义内容严重受损)与存在严重错误(仅扭曲源文本情感)的有意义翻译上的性能。我们得出结论,需要对自动指标进行微调,使其在检测情感严重错误时更加稳健。
引用
@article{arxiv.2109.14250,
title = {BLEU, METEOR, BERTScore: Evaluation of Metrics Performance in Assessing Critical Translation Errors in Sentiment-oriented Text},
author = {Hadeel Saadany and Constantin Orasan},
journal= {arXiv preprint arXiv:2109.14250},
year = {2021}
}
备注
Accepted for TRITON (TRanslation and Interpreting Technology ONline) 2021