RingFormer:一种集成环状注意力与卷积增强变换器的神经语音合成器
声音
2025-12-30 v2 机器学习
音频与语音处理
摘要
虽然变换器在各种音频任务中表现出色,但其应用于神经语音合成器仍富有挑战性。神经语音合成器要求在样本级别生成长音频信号,这需要高时间分辨率,导致注意力图生成计算成本高昂,限制了其高效处理全局和局部信息的能力。此外,语音合成器中样本生成的序列性质使得实时处理困难,使得直接采用变换器变得不实用。为此,我们提出了RingFormer,这是一种将环状注意力机制融入轻量级变换器变体——卷积增强变换器(Conformer)的神经语音合成器。环状注意力有效捕获局部细节,同时整合全局信息,使其适用于处理长序列并实现实时音频生成。RingFormer采用对抗训练进行训练,包含两个判别器。所提出的模型应用于文本到语音模型VITS的解码器,并在相同条件下与HiFi-GAN、iSTFT-Net和BigVGAN等最新语音合成器进行比较,使用各种客观和主观指标。实验结果表明,RingFormer在实现 comparable 或更好性能方面与现有模型相当,尤其在实时音频生成方面表现突出。我们的代码和音频样本已在GitHub上提供。
引用
@article{arxiv.2501.01182,
title = {RingFormer: A Neural Vocoder with Ring Attention and Convolution-Augmented Transformer},
author = {Seongho Hong and Yong-Hoon Choi},
journal= {arXiv preprint arXiv:2501.01182},
year = {2025}
}
备注
Accepted for publication in IEEE Transactions on Human-Machine Systems (THMS)