中文

基于 LCS 对齐增强的声学转录鲁棒性——LCS-CTC

音频与语音处理 2025-08-15 v2

摘要

语音 phonetic 转录对于细粒度语言分析和下游语音应用至关重要。虽然 Connectionist Temporal Classification(CTC)因其高效性而被广泛用于此类任务,但在不清晰和非流利语音下往往表现不足。本文提出 LCS-CTC,一个两阶段框架,用于语音的 phoneme 级识别,将基于相似性的局部对齐算法与受约束的 CTC 训练目标相结合。通过预测细粒度帧-phoneme 成本矩阵并应用修改版最长公共子序列(LCS)算法,我们的方法识别出高置信度对齐区块,这些区块用于约束 CTC 解码路径空间,从而减少过拟合并提升泛化能力,这使我们能够实现稳健的识别和无文本的强制对齐。在 LibriSpeech 和 PPA 上的实验表明,LCS-CTC 持续优于 vanilla CTC 基线,表明其在流利和非流利语音上统一 phoneme 建模具有潜力。

关键词

引用

@article{arxiv.2508.03937,
  title  = {LCS-CTC: Leveraging Soft Alignments to Enhance Phonetic Transcription Robustness},
  author = {Zongli Ye and Jiachen Lian and Akshaj Gupta and Xuanru Zhou and Haodong Li and Krish Patel and Hwi Joo Park and Dingkun Zhou and Chenxu Guo and Shuhe Li and Sam Wang and Iris Zhou and Cheol Jun Cho and Zoe Ezzes and Jet M. J. Vonk and Brittany T. Morin and Rian Bogley and Lisa Wauters and Zachary A. Miller and Maria Luisa Gorno-Tempini and Gopala Anumanchipalli},
  journal= {arXiv preprint arXiv:2508.03937},
  year   = {2025}
}

备注

2025 ASRU. Correct Author List