中文

盲文转语音生成器:基于CLIP和Fastspeech2联合微调的音频生成

声音 2024-07-22 v1 计算与语言 音频与语音处理

摘要

越来越多的中国人受视力障碍的不同程度的困扰,这使得将单一图像或视频帧在视觉场中转换为表达相同信息的音频成为一个研究热点。OCR+Vocoder和Im2Wav等深度学习技术使英语语音合成或图像到声音匹配成为自监督方式。然而,训练所用的音频数据有限,且英语并不普适于不同教育水平的视障人士。因此,为解决数据量和语言适用性问题,以提高视障人士的阅读效率,构建了一套基于中文语境的图像到语音框架CLIP-KNN-Fastspeech2。该框架整合了多个基础模型,采用独立预训练和联合微调策略。首先,在两个公开数据集MUGE和Baker上分别对中文CLIP和Fastspeech2文本到语音模型进行预训练,并验证了其收敛性。随后,在自构建的盲文图像数据集上进行联合微调。在多个公开数据集(包括VGGSound、Flickr8k、ImageHear和自构建的盲文数据集BIT-DP)上的实验结果表明,该模型在客观指标(如BLEU4、FAD(Fréchet Audio Distance)、WER(词错误率))和推理速度方面均有所提高。这验证了在有限数据下,构建的模型仍具备合成高质量语音的能力,也证明了整合多个基础模型的联合训练策略的有效性。

关键词

引用

@article{arxiv.2407.14212,
  title  = {Braille-to-Speech Generator: Audio Generation Based on Joint Fine-Tuning of CLIP and Fastspeech2},
  author = {Chun Xu and En-Wei Sun},
  journal= {arXiv preprint arXiv:2407.14212},
  year   = {2024}
}