中文

一种用于自适应语音时长修改的深度贝叶斯框架

音频与语音处理 2021-07-13 v1 机器学习 声音 信号处理

摘要

我们提出首个自适应修改给定语音信号时长的方法。我们的方法使用贝叶斯框架定义连接输入与目标语句帧的潜在注意力图。我们训练一个掩码卷积编码器-解码器网络,通过随机版平均绝对误差损失函数来生成该注意力图;我们的模型还利用编码器嵌入预测目标语音信号的长度。预测长度决定解码器操作的步数。在推理时,我们生成注意力图作为给定输入语音与未知目标语音信号之间相似度矩阵的代理。利用该相似度矩阵,我们计算两信号间的对齐弯曲路径。我们的实验表明,该自适应框架在语音转换与情感转换任务上取得了与依赖已知目标信号的动态时间规整(dynamic time warping)相似的结果。我们还表明,我们的技术所生成语音的质量与最先进的声码器(vocoder)相当。

关键词

引用

@article{arxiv.2107.04973,
  title  = {A Deep-Bayesian Framework for Adaptive Speech Duration Modification},
  author = {Ravi Shankar and Archana Venkataraman},
  journal= {arXiv preprint arXiv:2107.04973},
  year   = {2021}
}

备注

6 pages, 7 figures