中文

通过标签先验减少 CTC 的峰值输出并提高强制对齐精度

音频与语音处理 2024-07-22 v3 人工智能 计算与语言 机器学习

摘要

连接式时间分类(CTC)模型已知具有峰值输出分布。这种行为对自动语音识别(ASR)并非问题,但会导致在更细粒度(如音素级)上的准确强制对齐不准。本文旨在通过利用标签先验来缓解 CTC 的峰值行为,从而提高其用于生成强制对齐的适用性。具体而言,通过提升包含更少空白符的对齐路径得分并在训练中最大化这些得分,使我们的 CTC 模型产生更不峰值的后验概率分布,从而能够更准确地预测除音素起始位置之外的其他时间戳。我们的方法在 Buckeye 和 TIMIT 数据集上相较于标准 CTC 模型和基于启发式方法获取 CTC 标记时间戳的方法,在音素边界错误(PBE)和词边界错误(WBE)方面提高了 12%~40%。尽管在 Buckeye 数据集上与最广泛使用的强制对齐工具 Montreal Forced Aligner (MFA) 在 PBE/WBE 上表现相当,但在 TIMIT 上稍逊于 MFA。不过,我们的方法具有更简洁的训练流程和更好的运行效率。我们的训练配方和预训练模型已发布在 TorchAudio 中。

关键词

引用

@article{arxiv.2406.02560,
  title  = {Less Peaky and More Accurate CTC Forced Alignment by Label Priors},
  author = {Ruizhe Huang and Xiaohui Zhang and Zhaoheng Ni and Li Sun and Moto Hira and Jeff Hwang and Vimal Manohar and Vineel Pratap and Matthew Wiesner and Shinji Watanabe and Daniel Povey and Sanjeev Khudanpur},
  journal= {arXiv preprint arXiv:2406.02560},
  year   = {2024}
}

备注

Accepted by ICASSP 2024. Github repo: https://github.com/huangruizhe/audio/tree/aligner_label_priors