中文

面向会话语音标点预测的多模态半监督学习框架

音频与语音处理 2020-08-04 v1 计算与语言

摘要

在这项工作中,我们通过从大量无标注音频和文本数据中学习表示,探索了一种用于标点预测的多模态半监督学习方法。语音处理中的常规方法通常使用强制对齐将每帧声学特征编码为词级特征,并对所得声学与词汇表示进行多模态融合。作为替代,我们探索了基于注意力的多模态融合,并将其性能与基于强制对齐的融合进行比较。在 Fisher 语料库上进行的实验表明,我们提出的方法在参考转录文本和 ASR 输出上分别比基线 BLSTM 模型实现了约 6-9% 和约 3-4% 的绝对提升(F1 分数)。我们通过使用 N-best 列表进行数据增强进一步提升了模型对 ASR 错误的鲁棒性,在 ASR 输出上额外实现了高达约 2-6% 的提升。我们还通过对不同规模语料库进行消融研究证明了半监督学习方法的有效性。当在 1 小时语音和文本数据上训练时,所提模型比基线模型实现了约 9-18% 的绝对提升。

关键词

引用

@article{arxiv.2008.00702,
  title  = {Multimodal Semi-supervised Learning Framework for Punctuation Prediction in Conversational Speech},
  author = {Monica Sunkara and Srikanth Ronanki and Dhanush Bekal and Sravan Bodapati and Katrin Kirchhoff},
  journal= {arXiv preprint arXiv:2008.00702},
  year   = {2020}
}

备注

Accepted for Interspeech 2020