中文

规避数据瓶颈:基于自动分段语音翻译语料库的自动字幕生成

计算与语言 2022-11-18 v2

摘要

字幕语音翻译(SubST)的任务是自动将语音数据翻译为格式良好的字幕,并插入符合特定显示规范的字幕断点。与语音翻译(ST)类似,模型训练需要由音频输入及其文本译文组成的平行数据。然而在SubST中,文本还须标注字幕断点。迄今为止,这一要求构成了系统开发的瓶颈,公开可用的SubST语料之匮乏便证实了这一点。为弥补此缺口,我们提出一种无需人工干预即可将现有ST语料转换为SubST资源的方法。我们构建了一个分段器模型,以多模态方式利用音频与文本自动将文本切分为恰当字幕,在零样本条件下实现了较高的分段质量。分别基于人工与自动分段训练的SubST系统的对比实验表现出相近性能,显示了我们方法的有效性。

关键词

引用

@article{arxiv.2209.10608,
  title  = {Dodging the Data Bottleneck: Automatic Subtitling with Automatically Segmented ST Corpora},
  author = {Sara Papi and Alina Karakanta and Matteo Negri and Marco Turchi},
  journal= {arXiv preprint arXiv:2209.10608},
  year   = {2022}
}