中文

通过新方法和 MultiNAM 数据集推进 NAM 到语音转换

声音 2025-01-24 v2 人工智能 音频与语音处理

摘要

当前非语音 Murmur(NAM)到语音技术依赖语音克隆来模拟来自配对低语音的真实语音。但模拟语音往往缺乏可理解性,且难以在不同说话人之间泛化。为此,我们聚焦于从配对低语音和文本中学习音素级对齐,并采用语音合成(TTS)系统来模拟真实语音。为减少对低语音的依赖,我们直接从 NAM 中学习音素对齐,尽管其质量受限于可用训练数据的大小。为进一步减轻对 NAM/低语音数据的依赖以进行真实语音模拟,我们提出引入唇部模态来推断语音,并引入一种新的基于扩散的方法,利用最新进展在唇部到语音技术。此外,我们发布了 MultiNAM 数据集,包含来自两个说话人的超过 7.96 小时的配对 NAM、低语音、视频和文本数据,并在此数据集上对所有方法进行基准测试。语音样本和数据集可在 https://diff-nam.github.io/DiffNAM/ 查看。

关键词

引用

@article{arxiv.2412.18839,
  title  = {Advancing NAM-to-Speech Conversion with Novel Methods and the MultiNAM Dataset},
  author = {Neil Shah and Shirish Karande and Vineet Gandhi},
  journal= {arXiv preprint arXiv:2412.18839},
  year   = {2025}
}

备注

Accepted at IEEE ICASSP 2025