中文

使用持续预训练平衡基于编解码器的语音 LLM 中的语音理解与生成

音频与语音处理 2025-12-01 v2

摘要

语音语言模型(LLM)的最新进展已将文本 LLM 扩展至语音领域,但平衡语音理解与生成仍具挑战性,尤其是在使用基于编解码器的表示时。我们提出了一种持续预训练(CPT)框架,该框架调整文本 LLM 以处理编解码器离散化的语音,从而缓解模态失配并保留语言推理能力。我们的统一模型同时支持理解与生成,在 ASR、TTS、S2T-Trans 和 S2S-Trans 上均取得了优异结果。值得注意的是,我们提出了首个仅使用神经编解码器 token 的端到端、单次 S2S-Trans 系统,无需中间转录、翻译或语义 token。CPT 对于跨模态对齐和任务泛化至关重要,使其成为构建鲁棒的统一语音 LLM 的强大工具。

关键词

引用

@article{arxiv.2502.16897,
  title  = {Balancing Speech Understanding and Generation Using Continual Pre-training for Codec-based Speech LLM},
  author = {Jiatong Shi and Chunlei Zhang and Jinchuan Tian and Junrui Ni and Hao Zhang and Shinji Watanabe and Dong Yu},
  journal= {arXiv preprint arXiv:2502.16897},
  year   = {2025}
}

备注

Accepted by ASRU2025