中文

TorchDIVA:基于开源机器学习库构建的可扩展语音产生计算模型

音频与语音处理 2022-10-19 v1 机器学习 声音

摘要

DIVA 模型是一种语音运动控制的计算模型,它将负责语音产生的脑区模拟与人声道模型相结合。该模型目前以 Matlab Simulink 实现;然而这并不理想,因为语音技术研究中大多数开发工作是在 Python 中完成的。这意味着 Python 生态系统中大量免费可用的机器学习工具无法轻易与 DIVA 集成。我们提出 TorchDIVA,即使用 PyTorch 张量在 Python 中对 DIVA 的完整重建。DIVA 源代码直接从 Matlab 翻译为 Python,并从头实现了内置的 Simulink 信号模块。实现后,通过系统的逐块验证评估了每个模块的精度。结果表明 TorchDIVA 模型产生的输出与原始 DIVA 模型非常匹配,两者差异可忽略不计。我们还展示了 TorchDIVA 作为研究平台可扩展性的一个示例。TorchDIVA 中的语音质量增强是通过与现有的名为 DiffWave 的 PyTorch 生成式声码器集成实现的。一个改进的 DiffWave mel 频谱上采样器在人类语音波形上训练,并以 TorchDIVA 语音产生为条件。结果表明,与基线相比,DiffWave 增强的输出在语音质量指标上有所改善。这种增强在原始 Matlab 实现中很难或不可能完成。该概念验证展示了 TorchDIVA 将为研究界带来的价值。研究者可在 https://github.com/skinahan/DIVA_PyTorch 下载新实现。

关键词

引用

@article{arxiv.2210.09334,
  title  = {TorchDIVA: An Extensible Computational Model of Speech Production built on an Open-Source Machine Learning Library},
  author = {Sean Kinahan and Julie Liss and Visar Berisha},
  journal= {arXiv preprint arXiv:2210.09334},
  year   = {2022}
}