中文

EPIK: 通过知识蒸馏消除多模型流水线

计算与语言 2022-11-29 v1 人工智能

摘要

现实世界任务在很大程度上由多个模型组成,每个模型在更大的任务链中执行子任务,即把一个模型的输出作为另一模型的输入,形成多模型流水线。诸如 MATRa 之类的模型以两阶段执行跨语言音译任务,在以两种印度语言互译时,使用英语作为中间音译目标。我们提出一种新颖的蒸馏技术 EPIK,将分层任务的两阶段流水线压缩为单一端到端模型而不损及性能。该方法可在无需专用端到端数据集的情况下为任务创建端到端模型,从而解决数据稀缺问题。EPIK 模型已通过此知识蒸馏技术从 MATra 模型蒸馏得到。MATra 模型可在 5 种语言——英语、印地语、泰米尔语、卡纳达语和孟加拉语——之间执行跨语言音译。EPIK 模型执行音译任务时不产生任何中间英语输出,同时保留了 MATra 模型的性能与准确率。EPIK 模型的平均 CER 得分为 0.015,平均语音准确率为 92.1%。此外,与教师模型相比,平均执行时间减少了 54.3%,且与教师编码器相似度达 97.5%。在少数情况下,EPIK 模型(学生模型)虽自 MATra 模型蒸馏而来,却可优于 MATra 模型(教师模型)。

关键词

引用

@article{arxiv.2211.14920,
  title  = {EPIK: Eliminating multi-model Pipelines with Knowledge-distillation},
  author = {Bhavesh Laddagiri and Yash Raj and Anshuman Dash},
  journal= {arXiv preprint arXiv:2211.14920},
  year   = {2022}
}