基于分类的质量估计:面向真实应用场景的小型高效模型
计算与语言
2021-09-20 v1
摘要
机器翻译的句子级质量估计(QE)传统上被建模为回归任务,QE模型的性能通常通过与人标标签的Pearson相关系数来衡量。近期的QE模型已达到了前所未有的与人类判断的相关性水平,但它们依赖于计算代价高昂的大型多语言上下文语言模型,使其在真实应用场景中难以落地。在本工作中,我们评估了多种面向QE的模型压缩技术,发现尽管这些技术在其它NLP任务中广受欢迎,它们在回归设定下却导致糟糕的性能。我们观察到,要在回归任务中取得SOTA结果需要完整的模型参数化。然而,我们认为鉴于QE的下游应用,模型在连续区间上的表达能力是不必要的,并表明将QE重新定义为分类问题并使用分类指标评估QE模型,能更好地反映其在真实应用中的实际性能。
引用
@article{arxiv.2109.08627,
title = {Classification-based Quality Estimation: Small and Efficient Models for Real-world Applications},
author = {Shuo Sun and Ahmed El-Kishky and Vishrav Chaudhary and James Cross and Francisco Guzmán and Lucia Specia},
journal= {arXiv preprint arXiv:2109.08627},
year = {2021}
}
备注
EMNLP 2021