面向实用流式 ASR 的轻量级目标说话人基准重叠转录
音频与语音处理
2025-06-26 v1 声音
摘要
重叠语音仍是自动语音识别(ASR)在实际应用中面临的主要挑战,尤其是在具有动态、多说话人互动的广播媒体中。我们提出一种轻量级、基于目标说话人的扩展方案,用于现有流式ASR系统,以实现对重叠语音的实用转录,同时对计算开销几乎没有影响。我们的方案将用于标准操作的说话人无关(SI)模型与在重叠场景中选择性应用的说话人条件(SC)模型相结合。通过在冻结的SI模型输出上训练的紧凑二进制分类器实现重叠检测,几乎不产生额外开销。SC模型采用特征线性调制(FiLM)来整合说话人嵌入,并在人工混合数据上训练,以仅转录目标说话人。该方法支持动态说话人跟踪,并可通过最小修改复用现有模块。我们在包含16%重叠的捷克电视辩论数据集上进行评估,系统将重叠段落的错误率从68.0%(基线)降至35.78%,而总计算负载仅增加了44%。该提议系统为连续ASR服务中的重叠转录提供了有效且可扩展的解决方案。
引用
@article{arxiv.2506.20288,
title = {Lightweight Target-Speaker-Based Overlap Transcription for Practical Streaming ASR},
author = {Aleš Pražák and Marie Kunešová and Josef Psutka},
journal= {arXiv preprint arXiv:2506.20288},
year = {2025}
}