基于说话人无关活跃流的多说话人语音识别扩缩放
音频与语音处理
2025-10-07 v1 声音
摘要
使用说话人活跃信号来适应用于重叠语音的单说话人语音识别(ASR)已成为一种日益常见的训练范式。虽然这种方法有效,但这些系统需要为每个说话人运行一次 ASR 模型,导致推理成本随说话人数量线性增长,限制了其实际应用性。本文提出一种方法,通过将说话人特定的活跃输出转换为两个说话人无关的流,来实现说话人无关的 ASR 推理成本。中心性挑战在于,若简单地将说话人活跃合并到流中,将显著降低识别效果,因为预训练的 ASR 模型假设输入为连续的单说话人信号。为此,我们设计了新的启发式方法,旨在保留对话连续性并保持与现有系统的兼容性。我们展示了该方法可与基于说话人无关活跃的 Whisper(DiCoW)兼容,在 AMI 和 ICSI 会议数据集上大幅减少运行时间,同时保持竞争的性能。
引用
@article{arxiv.2510.03630,
title = {Scaling Multi-Talker ASR with Speaker-Agnostic Activity Streams},
author = {Xiluo He and Alexander Polok and Jesús Villalba and Thomas Thebaud and Matthew Maciejewski},
journal= {arXiv preprint arXiv:2510.03630},
year = {2025}
}