面向挑战性注册场景的基于上下文感知注意力机制的端到端目标说话人语音识别
音频与语音处理
2025-01-28 v1 声音
摘要
本文提出了一种新型的流式端到端目标说话人语音识别方法,旨在解决系统中两项关键限制:对噪声注册语音的处理以及特定注册短语的要求。本文提出了具备双注意力机制的稳健目标说话人循环神经网络旁路(transducer,TS-RNNT),用于上下文偏置和叠加注册处理。该模型包含专为从噪声、叠加注册音频中提取相关说话人特征而设计的文本解码器和注意力机制。合成数据集上的实验结果表明,该模型具有鲁棒性,即使在信号干扰比(SIR)为 5dB 的叠加注册情况下,词错误率(WER)仍保持在 16.44%,而传统方法在类似条件下会恶化到 WER 超过 75%。这一显著的性能提升,结合该模型的半文本依赖注册能力,标志着向更加实用和灵活的语音控制设备迈进了重要一步。
引用
@article{arxiv.2501.15466,
title = {End-to-End Target Speaker Speech Recognition Using Context-Aware Attention Mechanisms for Challenging Enrollment Scenario},
author = {Mohsen Ghane and Mohammad Sadegh Safari},
journal= {arXiv preprint arXiv:2501.15466},
year = {2025}
}