中文

生成式基础模型生成的合成音频能否助力音频识别与语音建模?

声音 2024-08-30 v2 机器学习 音频与语音处理

摘要

近期的基础模型进展已使音频生成模型能够产生与音乐、事件和人类动作相关的高保真音频。尽管现代音频生成模型在实现方面取得了成功,但评估音频生成质量的常规方法仍严重依赖诸如 Frechet Audio Distance 等距离度量方法。相反,我们旨在通过考察将其用作训练数据的效果来评估音频生成的质量。具体而言,我们开展了研究,以探讨合成音频用于音频识别的可能性。此外,我们调查了合成音频能否作为语音相关建模的数据增强资源。我们的全面实验表明,合成音频在音频识别和语音相关建模方面的潜力巨大。我们的代码已公开于 https://github.com/usc-sail/SynthAudio。

关键词

引用

@article{arxiv.2406.08800,
  title  = {Can Synthetic Audio From Generative Foundation Models Assist Audio Recognition and Speech Modeling?},
  author = {Tiantian Feng and Dimitrios Dimitriadis and Shrikanth Narayanan},
  journal= {arXiv preprint arXiv:2406.08800},
  year   = {2024}
}

备注

Accepted to 2024 INTERSPEECH; corrections to ActivityNet labels