BrainTalker:使用Wav2Vec 2.0迁移学习的低资源脑到语音合成
音频与语音处理
2023-12-22 v1 声音
摘要
从大脑神经活动解码语音是一个快速兴起的研究课题,因为它可以为难以产生可听语音的人提供通信能力。对于此任务,皮层脑电图(ECoG)是一种常见方法,具有高时间分辨率和高空间精度。然而,由于获取ECoG记录需要高风险的外科手术,此类数据收集相对较少,不足以训练基于神经网络的脑到语音(BTS)系统。为解决此问题,我们提出BrainTalker——一种新颖的BTS框架,能够在极低资源场景下从ECoG信号生成可理解的语音。我们应用迁移学习方法,利用预训练的自监督模型Wav2Vec 2.0。具体而言,我们训练一个编码器模块,将ECoG信号映射到与对应语音的Wav2Vec 2.0表示相匹配的潜在嵌入。然后,这些嵌入通过堆叠的卷积层和基于变换器的层转换为梅尔频谱图,并输入神经声码器以合成语音波形。实验结果表明,我们的框架在主观和客观指标上均取得了出色性能,包括生成梅尔频谱图与真实梅尔频谱图之间的皮尔逊相关系数达到0.9。我们公开分享了演示和代码。
关键词
引用
@article{arxiv.2312.13600,
title = {BrainTalker: Low-Resource Brain-to-Speech Synthesis with Transfer Learning using Wav2Vec 2.0},
author = {Miseul Kim and Zhenyu Piao and Jihyun Lee and Hong-Goo Kang},
journal= {arXiv preprint arXiv:2312.13600},
year = {2023}
}
备注
5 pages. Accepted to BHI 2023