中文

DualVC 3:利用语言模型生成的伪上下文实现端到端低延迟流式语音转换

音频与语音处理 2024-06-13 v1

摘要

流式语音转换因其在实时应用中的潜力而日益受到欢迎。最近提出的 DualVC 2 已实现约180ms 的低延迟高质量流式语音转换。然而,识别-合成框架阻碍了端到端优化,且自动语音识别(ASR)模型在短语片段上的不稳定性使得进一步降低延迟具有挑战性。为此,我们提出一种端到端模型 DualVC 3。通过使用 speaker-independent 语义标记引导内容编码器的训练,消除了对 ASR 的依赖,模型可在极小的语片上运行,消除级联误差。一种语言模型在内容编码器输出上进行训练,通过迭代预测未来帧生成伪上下文,为解码器提供更丰富的上下文信息以提高转换质量。实验结果表明,DualVC 3 在主观和客观指标上与 DualVC 2 相当,仅需 50ms 的延迟。

关键词

引用

@article{arxiv.2406.07846,
  title  = {DualVC 3: Leveraging Language Model Generated Pseudo Context for End-to-end Low Latency Streaming Voice Conversion},
  author = {Ziqian Ning and Shuai Wang and Pengcheng Zhu and Zhichao Wang and Jixun Yao and Lei Xie and Mengxiao Bi},
  journal= {arXiv preprint arXiv:2406.07846},
  year   = {2024}
}

备注

Accepted by Interspeech 2024