面向日英聊天翻译的自动化指标评估分析
计算与语言
2024-12-25 v1 人工智能
摘要
本文分析了传统基线指标(如 BLEU 和 TER)和神经网络方法(如 BERTScore 和 COMET)在评估日英聊天翻译中几种 NMT 模型性能时的评分情况,以及这些指标与人工标注分数之间的相关性。结果表明,在对聊天翻译中的 NMT 模型进行排名时,所有指标在决定哪个模型优于另一个模型方面都相当一致。这意味着虽然传统基线指标较快且使用更简单,仍然有助于使用。另一方面,当与人类判断力的相关性比较时,神经网络方法优于传统方法,其中 COMET 在日英聊天翻译中与人工标注分数相关性最高。然而,我们还展示了即便是最佳指标在评分包含日语中指代消失零代词的英文翻译时也面临挑战。
引用
@article{arxiv.2412.18190,
title = {An Analysis on Automated Metrics for Evaluating Japanese-English Chat Translation},
author = {Andre Rusli and Makoto Shishido},
journal= {arXiv preprint arXiv:2412.18190},
year = {2024}
}
备注
Accepted at the 29th Annual Meeting of the Association for Natural Language Processing (NLP2023). Published version available at https://www.anlp.jp/proceedings/annual_meeting/2023/pdf_dir/A8-1.pdf