利用广播媒体字幕转录文本进行自动语音识别与字幕生成
音频与语音处理
2025-02-06 v1 声音
摘要
语音识别技术的最新进展得益于大规模数据集和基于注意力的架构,但许多挑战依然存在,尤其是对于低资源语言和方言。本文探讨了将电视字幕中的弱监督转录文本集成到自动语音识别 (ASR) 系统中,旨在改进逐字转录和自动生成的字幕。为此,由于逐字数据和字幕具有不同的特性,它们被视为不同的领域或语言。我们提出并比较了几种端到端架构,这些架构旨在使用分离或共享的编码器和解码器对两种模态进行联合建模。所提出的方法能够联合生成逐字转录和字幕。在弗拉芒语(比利时荷兰语)上的评估表明,具有级联编码器和分离解码器的模型能够最有效地表示两种数据类型之间的差异,同时在这两个领域都取得了改进。尽管存在领域和语言变异的差异,但将逐字转录与字幕数据相结合,无需大量预处理即可显著提高 ASR 性能。此外,使用大规模字幕数据集进行的实验显示了所提出方法的可扩展性。这些方法不仅提高了 ASR 的准确率,还能生成与标准书面文本紧密匹配的字幕,提供了多种潜在应用。
引用
@article{arxiv.2502.03212,
title = {Leveraging Broadcast Media Subtitle Transcripts for Automatic Speech Recognition and Subtitling},
author = {Jakob Poncelet and Hugo Van hamme},
journal= {arXiv preprint arXiv:2502.03212},
year = {2025}
}
备注
Preprint