中文

时域多模态骨传导/气传导语音增强

音频与语音处理 2020-08-25 v3 声音 信号处理

摘要

先前研究已证明,将视频信号作为互补模态可促进语音增强(SE)性能的提升。然而,视频片段通常包含大量数据,并在计算资源上带来高成本,从而可能使 SE 系统复杂化。作为替代来源,骨传导语音信号数据量适中,同时呈现语音音素结构,因而可与其气传导对应信号互补。在本研究中,我们提出了一种利用骨传导与气传导信号的时域新型多模态 SE 结构。此外,我们考察了两种基于集成学习的策略——早期融合(EF)与晚期融合(LF)——来整合这两类语音信号,并采用基于深度学习的全卷积网络进行增强。在普通话语料库上的实验结果表明,这一新提出的多模态(整合骨传导与气传导信号)SE 结构在各种语音评价指标上显著优于单源 SE 对应结构(仅含骨传导或气传导信号)。此外,在该新型 SE 多模态结构中采用 LF 策略而非 EF 取得了更好的结果。

关键词

引用

@article{arxiv.1911.09847,
  title  = {Time-Domain Multi-modal Bone/air Conducted Speech Enhancement},
  author = {Cheng Yu and Kuo-Hsuan Hung and Syu-Siang Wang and Szu-Wei Fu and Yu Tsao and Jeih-weih Hung},
  journal= {arXiv preprint arXiv:1911.09847},
  year   = {2020}
}

备注

multi-modal, bone/air-conducted signals, speech enhancement, fully convolutional network