中文

FuseCodec:语义-上下文融合与神经音频编解码器

声音 2025-09-30 v2 人工智能 计算与语言 音频与语音处理

摘要

语音分词使离散表示成为可能,并促进了语音语言建模。然而,现有的神经音频编解码器仅捕获低层声学特征,忽略了人类语音中固有的语义和上下文线索。虽然最近的工作从自监督语音模型中引入语义表示或整合来自预训练语言模型的上下文表示,但仍面临对齐和统一语义与上下文表示的挑战。我们提出FuseCodec,通过强大的跨模态对齐和全局感知监督,将声学、语义和上下文表示统一起来。我们提出了三种互补技术:(i) 潜在表示融合,直接将语义和上下文特征整合到编码器潜在空间中,以实现稳健且统一的表示学习;(ii) 全局语义-上下文监督,通过全局池化和广播表示来监督离散标记,以增强时序一致性和跨模态对齐;(iii) 时序对齐的上下文监督,通过在局部窗口内动态匹配上下文和语音标记来加强对齐,以实现细粒度的标记级监督。我们进一步提出FuseCodec-TTS,表明该方法论方法适用于零样法语音合成。经验上,FuseCodec 在 LibriSpeech 上实现了领先于 EnCodec、SpeechTokenizer 和 DAC 的性能,在转录准确率、感知质量、可理解性和说话人相似性方面均取得优异成绩。结果凸显了受语义和上下文指导的语音分词对语音分词及下游任务的有效性。代码和预训练模型可在 https://github.com/mubtasimahasan/FuseCodec 上获取。

关键词

引用

@article{arxiv.2509.11425,
  title  = {FuseCodec: Semantic-Contextual Fusion and Supervision for Neural Codecs},
  author = {Md Mubtasim Ahasan and Rafat Hasan Khan and Tasnim Mohiuddin and Aman Chadha and Tariq Iqbal and M Ashraful Amin and Amin Ahsan Ali and Md Mofijul Islam and A K M Mahbubur Rahman},
  journal= {arXiv preprint arXiv:2509.11425},
  year   = {2025}
}