面向端到端语音识别的最佳字节级表示优化
音频与语音处理
2024-09-06 v2 计算与语言
摘要
我们提出了一种新方法,用于优化面向端到端自动语音识别(ASR)的字节级表示。字节级表示常用于大规模多语言 ASR 系统,以支持大字符集。字节级表示的紧凑性和通用性允许 ASR 模型使用更小的输出词汇,从而提供更大的灵活性。UTF-8 是字节级表示的常用形式,但其并非针对机器学习任务进行优化。通过采用自编码器和向量量化,我们表明可以为 ASR 优化字节级表示并实现更好的准确率。我们提出的框架可以整合来自不同模态的信息,并提供一种错误纠正机制。在英汉双语语音输入任务中,我们表明使用本方法构建的双语 ASR 模型相对于 UTF-8 表示在错误率上可提升约 5%。
引用
@article{arxiv.2406.09676,
title = {Optimizing Byte-level Representation for End-to-end ASR},
author = {Roger Hsiao and Liuhui Deng and Erik McDermott and Ruchir Travadi and Xiaodan Zhuang},
journal= {arXiv preprint arXiv:2406.09676},
year = {2024}
}
备注
5 pages, 1 figure, IEEE SLT 2024