中文

LLM-ForcedAligner:面向多语言与长语音的基于 LLM 的非自回归精确强制对齐器

声音 2026-02-02 v2 音频与语音处理

摘要

强制对齐(FA)预测语音中词或字符的开始和结束时间戳,但现有方法通常特定于某种语言,且容易出现累积时间偏移。语音大语言模型(SLLMs)的多语言语音理解与长序列处理能力,使其在多语言、跨语言和长语音场景下的 FA 中极具潜力。然而,将 SLLM 的下一词元预测范式直接应用于 FA 会导致幻觉和推理缓慢。为了弥合这一差距,我们提出了 LLM-ForcedAligner,将 FA 重新表述为填槽范式:时间戳被视为离散索引,并插入特殊时间戳词元作为槽位到转录文本中。以语音嵌入和带槽位的转录文本为条件,SLLM 直接预测槽位处的时间索引。在训练期间,具有非移位输入和标签序列的因果注意力掩码允许每个槽位基于自身及前文上下文预测其时间戳索引,且仅在槽位位置计算损失。动态槽位插入支持在任意位置进行 FA。此外,支持非自回归推理,避免了幻觉并提升了速度。在多语言、跨语言和长语音场景下的实验表明,与先前方法相比,LLM-ForcedAligner 在累积平均偏移上实现了 69%~78% 的相对减少。检查点和推理代码可在 https://github.com/QwenLM/Qwen3-ASR 获取。

关键词

引用

@article{arxiv.2601.18220,
  title  = {LLM-ForcedAligner: A Non-Autoregressive and Accurate LLM-Based Forced Aligner for Multilingual and Long-Form Speech},
  author = {Bingshen Mu and Xian Shi and Xiong Wang and Hexin Liu and Jin Xu and Lei Xie},
  journal= {arXiv preprint arXiv:2601.18220},
  year   = {2026}
}