中文

面向端到端语音翻译的基于粗标签的 CTC 高效正则化

计算与语言 2023-02-22 v1 声音 音频与语音处理

摘要

对于端到端语音翻译,以源语言转写文本或目标语言翻译文本作为标签、用连接时序分类(Connectionist Temporal Classification, CTC)目标对编码器进行正则化可大幅提升质量指标。然而,CTC 需在词汇空间上额外增加一个预测层,带来不可忽略的模型参数与计算开销,尽管该层通常不在推理时使用。本文重新审视 CTC 正则化对真实词汇标签的需求,并探索缩减 CTC 标签空间的策略,以在质量不退化前提下提升效率。我们提出 CTC 粗标签化(Coarse Labeling for CTC, CoLaCTC),通过截断、除法或取模(MOD)运算等简单启发式规则合并词汇标签。尽管简单,我们在 4 种源语言与 8 种目标语言上的实验表明,尤其采用 MOD 的 CoLaCTC 可将标签空间激进压缩至 256 甚至更小,获得训练效率提升(依原始词汇量大小达 1.18x ~ 1.77x 加速),且性能仍与 CTC 基线相当或更优。我们还表明 CoLaCTC 无论以转写文本还是翻译文本作标签,均能成功推广至 CTC 正则化。

关键词

引用

@article{arxiv.2302.10871,
  title  = {Efficient CTC Regularization via Coarse Labels for End-to-End Speech Translation},
  author = {Biao Zhang and Barry Haddow and Rico Sennrich},
  journal= {arXiv preprint arXiv:2302.10871},
  year   = {2023}
}

备注

EACL 2023