基于最优传输的数值序列到序列建模的可微对齐框架
机器学习
2025-11-24 v3 声音
音频与语音处理
机器学习
摘要
准确的序列到序列(seq2seq)对齐对于依赖自动语音识别(ASR)的医学语音分析和语言学习工具等应用至关重要。基于序列的CTC和转换模型等最先进的端到端(E2E)ASR系统存在尖锐行为和对齐不准确的问题。本文提出一种基于一维最优传输的新型可微对齐框架,使模型能够学习单一对齐并以E2E方式进行ASR。我们引入一种称为序列最优传输距离(SOTD)的伪度量,并讨论其理论属性。基于SOTD,我们提出用于ASR的Optimal Temporal Transport Classification(OTTC)损失,并与CTC进行对比分析。在TIMIT、AMI和LibriSpeech数据集上的实验结果表明,本方法在对齐性能上显著优于CTC和较新提出的一致性正则化CTC,尽管在ASR性能上存在权衡。我们认为本工作为序列到序列对齐研究开辟了新的方向,为社区进一步的探索和开发提供了坚实的基础。我们的代码已公开:https://github.com/idiap/OTTC
引用
@article{arxiv.2502.01588,
title = {A Differentiable Alignment Framework for Sequence-to-Sequence Modeling via Optimal Transport},
author = {Yacouba Kaloga and Shashi Kumar and Petr Motlicek and Ina Kodrasi},
journal= {arXiv preprint arXiv:2502.01588},
year = {2025}
}