中文

使用Bark与基于检索的语音转换为低资源ASR构建定制数据增强

声音 2024-01-11 v3 计算与语言 音频与语音处理

摘要

本文提出两种创新方法,为印地语等低资源语言构建定制的Common Voice数据集。第一种方法利用Suno开发的基于Transformer的文本到音频模型Bark,并融合Meta的enCodec与预训练HuBert模型以提升Bark的性能。第二种方法采用基于检索的语音转换(RVC),并使用Ozen工具包进行数据准备。两种方法均推动了ASR技术的进步,并为解决构建低资源语言定制Common Voice数据集的挑战提供了宝贵见解。此外,它们为实现面向多种应用的高质量个性化语音生成提供了一条途径。

关键词

引用

@article{arxiv.2311.14836,
  title  = {Custom Data Augmentation for low resource ASR using Bark and Retrieval-Based Voice Conversion},
  author = {Anand Kamble and Aniket Tathe and Suyash Kumbharkar and Atharva Bhandare and Anirban C. Mitra},
  journal= {arXiv preprint arXiv:2311.14836},
  year   = {2024}
}