SpikeVoice:基于高效脉冲神经网络的高质量文本转语音
神经与进化计算
2024-08-05 v1 机器学习
摘要
以脑为灵感的脉冲神经网络(SNN)在视觉、自然语言和语音理解任务中展现出有效性和效率,表明其具有“看到”、“听到”和“阅读”的能力。本文设计了¥¥SpikeVoice¥¦,通过SNN实现高质量文本转语音(TTS),以探索SNN“说话”的潜力。使用SNN进行此类生成任务的主要障碍在于模型需要把握长期依赖关系。然而,脉冲神经元的串行性质导致在未来脉冲时间步的信息不可见,限制SNN模型仅能捕获同一时间步内的序列依赖关系。我们称现象为“部分时间依赖”。为解决此问题,本文引入SpikeVoice中的脉冲时序顺序注意力(Spiking Temporal-Sequential Attention, STSA)。据我们所知,SpikeVoice是SNN领域首个TTS工作。我们使用四个既 established 数据集进行实验,涵盖中英文语言,包括单说话人和多说话人配置。结果表明,SpikeVoice的性能可与人工神经网络(ANN)相当,仅需ANN的10.5%能耗。
引用
@article{arxiv.2408.00788,
title = {SpikeVoice: High-Quality Text-to-Speech Via Efficient Spiking Neural Network},
author = {Kexin Wang and Jiahong Zhang and Yong Ren and Man Yao and Di Shang and Bo Xu and Guoqi Li},
journal= {arXiv preprint arXiv:2408.00788},
year = {2024}
}
备注
9 pages