中文

将文本相似性作为机器翻译质量估计中的关键指标

计算与语言 2024-07-02 v2 人工智能

摘要

机器翻译(MT)质量估计(QE)是在没有参考文本的情况下评估翻译可靠性。本研究引入了“文本相似性”作为 QE 的新指标,使用句子转换器和余弦相似性来衡量语义接近程度。分析了来自 MLQE-PE 数据集的数据,我们发现文本相似性与人类评分的相关性比传统指标(如 hter、模型评估、句子概率等)更强。运用广义可加模型(GAMMs)作为统计工具,我们证明了文本相似性在预测人类评分方面在多个语言对上始终优于其他指标。我们还发现“hter”实际上未能在 QE 中预测人类评分。我们的发现凸显了文本相似性作为稳健 QE 指标的有效性,建议将其集成到 QE 框架和 MT 系统训练中,以提高准确性和可用性。

关键词

引用

@article{arxiv.2406.07440,
  title  = {Textual Similarity as a Key Metric in Machine Translation Quality Estimation},
  author = {Kun Sun and Rong Wang},
  journal= {arXiv preprint arXiv:2406.07440},
  year   = {2024}
}