中文

MeWEHV:面向人声任务的梅尔与波形嵌入

声音 2023-06-27 v2 音频与语音处理

摘要

语音处理近期的一个趋势是使用通过针对特定任务在大型数据集上训练的机器学习模型所创建的嵌入。通过利用已获取的知识,这些模型可被复用于可用数据量较少的新任务中。本文提出一种称为面向人声任务的梅尔与波形嵌入(MeWEHV)的新模型构建流程,能够生成用于语音处理的鲁棒嵌入。MeWEHV 结合了由预训练原始音频波形编码器模型生成的嵌入,以及使用卷积神经网络(CNN)从梅尔频率倒谱系数(MFCC)提取的深度特征。我们在三项任务上评估 MeWEHV 的性能:说话人、语言和口音识别。对于第一项,我们使用 VoxCeleb1 数据集并推出 YouSpeakers204——一个新颖且公开可用的英语说话人识别数据集,包含来自以六种不同口音说话的 204 人的 19607 个音频片段,使其他研究者可使用高度平衡的数据集,并创建对多种口音鲁棒的模型。为评估语言识别任务,我们使用 VoxForge 和 Common Language 数据集。最后,对于口音识别,我们使用 Latin American Spanish Corpora (LASC) 和 Common Voice 数据集。我们的方法在所有测试数据集上显著提升了 SOTA 模型的性能,且额外计算成本很低。

关键词

引用

@article{arxiv.2209.14078,
  title  = {MeWEHV: Mel and Wave Embeddings for Human Voice Tasks},
  author = {Andrés Carofilis and Laura Fernández-Robles and Enrique Alegre and Eduardo Fidalgo},
  journal= {arXiv preprint arXiv:2209.14078},
  year   = {2023}
}

备注

Submitted to IEEE Access