低声语境:用于长语音转录的语法与语义蒸馏
计算与语言
2025-08-20 v1 人工智能
摘要
ASR系统在处理长音频转录时常常难以维持语法和语义的准确性,这会影响命名实体识别(NER)、首字母大写以及标点符号等任务。我们提出了一种新颖的方法,通过将LLaMA模型中的上下文知识蒸馏到Whisper模型中来增强ASR系统。该方法采用两种策略:(1)基于最优传输的数级蒸馏,以对齐维度和序列长度;(2)在Whisper与LLaMA的句子嵌入之间最小化表示损失,以融合语法和语义信息。我们在Spoken Wikipedia数据集上进行评估,该数据集包含长音频和丰富实体,结果在WER、NER、首字母大写和标点正确性方面均取得显著提升。通过引入新的NER指标并探索语义感知的ASR,我们的工作强调了将语言上下文集成到转录中的重要价值,为在长篇语音中的稳健、上下文感知的ASR奠定了基础。
引用
@article{arxiv.2508.13376,
title = {Whispering Context: Distilling Syntax and Semantics for Long Speech Transcripts},
author = {Duygu Altinok},
journal= {arXiv preprint arXiv:2508.13376},
year = {2025}
}
备注
Accepted to IEEE ASRU 2025. This is the preprint, all rights reserved for ASRU2025