中文

LS-EEND:基于在线引导提取的长篇流式端到端语音活动识别

音频与语音处理 2025-09-09 v2 声音

摘要

本工作提出一种帧级在线/流式端到端语音活动识别 (EEND) 方法,采用帧-in-frame-out 的方式检测说话人活动。该方法主要由因果嵌入编码器和在线引导解码器组成。说话人在基于自注意力的解码器中沿时间维度和说话人维度建模,帧级说话人引导自动生成和更新,用于新说话人和现有说话人。采用保留机制,并专为长篇语音识别设计,以实现线性时间复杂性。提出一种多步骤渐进式训练策略,逐步学习从易任务到难任务,其中说话人数量和音频长度是关键因素。最终,所提出的模型(称为长篇流式 EEND,LS-EEND)能够对高(最高可达 8)和灵活的说话人数量,以及很长(例如一小时)的音频录音进行流式语音活动识别。在各种模拟和真实世界数据集上的实验表明:1)在不使用 oracle 语音活动信息的情况下,所提出的模型在所有数据集上实现了所有数据集上新的状态-of-the-art 在线语音活动识别错误率,包括 CALLHOME (12.11%)、DIHARD II (27.58%)、DIHARD III (19.61%) 和 AMI (20.76%);2)由于帧-in-frame-out 处理方式和线性时间复杂性,所提出的模型在多个在线语音活动识别模型中实现了数倍的实时因子降低。

关键词

引用

@article{arxiv.2410.06670,
  title  = {LS-EEND: Long-Form Streaming End-to-End Neural Diarization with Online Attractor Extraction},
  author = {Di Liang and Xiaofei Li},
  journal= {arXiv preprint arXiv:2410.06670},
  year   = {2025}
}

备注

Accepted to IEEE Transactions on Audio, Speech and Language Processing