中文

基于语音调制丢弃的自监督学习

音频与语音处理 2023-03-24 v1 声音

摘要

我们表明,训练一个基于多头自注意力的深度网络,在一段1.5秒的语音片段上预测被删除的、信息密集的2-8 Hz语音调制,是使机器学会利用时域上下文信息提取语音调制的有效方法。我们的工作显示,一旦在大量无标签数据上完成训练,自注意力层的输出随时间变化并在4 Hz处呈现调制峰值。这些预训练层可用于初始化自动语音识别系统的部分结构,从而大幅降低其对有标签语音数据的依赖。

关键词

引用

@article{arxiv.2303.12908,
  title  = {Self-supervised Learning with Speech Modulation Dropout},
  author = {Samik Sadhu and Hynek Hermansky},
  journal= {arXiv preprint arXiv:2303.12908},
  year   = {2023}
}