无录入主讲者语音活动检测:基于自注意力引力点的 EEND-SAA 方法
音频与语音处理
2025-09-16 v1
摘要
语音活动检测(VAD)是语音系统中必不可少的技术,但传统方法仅检测语音存在,无法识别说话者。目标说话者语音活动检测(TS-VAD)通过检测已知说话者的语音,但在会议或客户服务电话等开放域场景中,这一假设因主讲者未知而失效。我们提出 EEND-SAA,一个无录入、兼容流式处理的主讲者语音活动检测框架,无需 prior knowledge 即可识别主要说话者。不同于 TS-VAD,本方法基于语音连续性和音量,确定主要说话者为谁说得更持续、更清晰。我们基于 EEND 构建模型,在 Transformer 中引入两个自注意力引力点,并应用因果遮蔽实现实时处理。在多说话者 LibriSpeech 混合信号实验中,EEND-SAA 将主讲者 DER 从 6.63% 降至 3.61%,F1 分数从 0.9667 提升至 0.9818,超越 SA-EEND baseline,实现了在说话者重叠和噪声环境下的 SOTA 性能。
引用
@article{arxiv.2509.11957,
title = {EEND-SAA: Enrollment-Less Main Speaker Voice Activity Detection Using Self-Attention Attractors},
author = {Wen-Yung Wu and Pei-Chin Hsieh and Tai-Shih Chi},
journal= {arXiv preprint arXiv:2509.11957},
year = {2025}
}