CJST:基于 CTC 压缩器的联合语音和文本训练用于解码器-only ASR
音频与语音处理
2025-01-03 v2 机器学习
声音
摘要
CTC 压缩器是一种有效将音频编码器集成到解码器-only 模型中的方法,已在不同语音应用中获得广泛关注。本文提出一种基于 CTC 压缩器的新型联合语音和文本训练(CJST)框架,用于解码器-only 自动语音识别(ASR)。CJST 通过探索简单的模态适配器和几个 CTC 压缩器特征(包括序列压缩、即时强制尖峰对齐和 CTC 类嵌入)实现双向语音和文本模态匹配。在 Librispeech 和 TED-LIUM2 语料库上的实验结果表明,所提 CJST 能够在无需处理时长的前提下实现有效的文本注入,实现内域和跨域场景的最佳性能。我们还提供了关于 CTC 压缩器的全面研究,涵盖各种压缩模式、边缘情况处理以及在干净和噪声数据条件下的行为,揭示了在解码器模型中使用 CTC 压缩器的最稳健设置。
关键词
引用
@article{arxiv.2411.07607,
title = {CJST: CTC Compressor based Joint Speech and Text Training for Decoder-Only ASR},
author = {Wei Zhou and Junteng Jia and Leda Sari and Jay Mahadeokar and Ozlem Kalinli},
journal= {arXiv preprint arXiv:2411.07607},
year = {2025}
}
备注
accepted at ICASSP2025