中文

从字幕到分割:改进低资源语音到文本翻译流水线

计算与语言 2020-10-20 v1

摘要

在本工作中,我们聚焦于在低资源语言语音到文本翻译背景下改进 ASR 输出分割。ASR 输出分割至关重要,因为 ASR 系统仅使用纯声学信息对输入音频分段,不能保证输出类句子片段。由于多数 MT 系统期望以句子为输入,送入较长未分割段落会导致次优性能。我们探索使用来自电视剧与电影的宇幕数据集训练更好的 ASR 分割模型的可行性。我们进一步将词性(POS)标签与依存标签信息(从未分割 ASR 输出导出)纳入分割模型。我们表明该含噪句法信息可提升模型准确率。我们在分割质量上内在评估模型,并在下游 MT 性能以及包括跨语言信息检索(CLIR)任务与人工相关性评估的下游任务上外在评估。我们的模型在立陶宛语与保加利亚语的下游任务上展示出改进性能。

关键词

引用

@article{arxiv.2010.09693,
  title  = {Subtitles to Segmentation: Improving Low-Resource Speech-to-Text Translation Pipelines},
  author = {David Wan and Zhengping Jiang and Chris Kedzie and Elsbeth Turcan and Peter Bell and Kathleen McKeown},
  journal= {arXiv preprint arXiv:2010.09693},
  year   = {2020}
}