中文

面向质量估计的知识蒸馏

计算与语言 2021-07-02 v1

摘要

质量估计(QE)是在无参考译文情况下自动预测机器翻译质量的任务,使其适用于实时场景,例如翻译在线社交媒体对话。QE 近期的成功源于多语言预训练表示的使用,其中非常大的模型带来了令人印象深刻的结果。然而,此类模型的推理时间、磁盘与内存需求不允许在现实世界中广泛使用。在蒸馏预训练表示上训练的模型对许多使用场景而言仍然过大。我们转而提出直接将知识从强大的 QE 教师模型迁移到具有不同、更浅架构的更小模型。我们表明,该方法结合数据增强,可得到轻量级 QE 模型,其以少 8 倍的参数数量与蒸馏预训练表示表现相当。

关键词

引用

@article{arxiv.2107.00411,
  title  = {Knowledge Distillation for Quality Estimation},
  author = {Amit Gajbhiye and Marina Fomicheva and Fernando Alva-Manchego and Frédéric Blain and Abiola Obamuyide and Nikolaos Aletras and Lucia Specia},
  journal= {arXiv preprint arXiv:2107.00411},
  year   = {2021}
}

备注

ACL Findings 2021