中文

TASU2:可控 CTC 仿真框架:用于语音 LLM 对齐与低资源适应

音频与语音处理 2026-04-10 v1 人工智能

摘要

语音 LLM 的后训练越来越依赖高效的跨模态对齐和稳健的低资源适应,但大规模音频文本对的收集成本较高。文本唯一对齐方法如 TASU 通过仿真 CTC 后验来减轻负担,但对不确定性和错误率的控制有限,导致课程设计主要是经验性的。我们提出 TASU2,一种可控 CTC 仿真框架,可在指定错误率范围内仿真 CTC 后验分布,生成更贴合声学解码接口的文本派生监督信号。这使得无需 TTS 的后训练课程设计得以原则化,平滑变化监督难度。 在多种源向目标适应场景下,TASU2 在域内和域外识别上均优于 TASU,持续超越包括文本唯一微调和 TTS 基于增强在内的强大基线,同时缓解了源域性能下降。

关键词

引用

@article{arxiv.2604.08384,
  title  = {TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs},
  author = {Jing Peng and Chenghao Wang and Yi Yang and Lirong Qian and Junjie Li and Yu Xi and Shuai Wang and Kai Yu},
  journal= {arXiv preprint arXiv:2604.08384},
  year   = {2026}
}