并发说话人检测:一种基于多麦克风 Transformer 的方法
音频与语音处理
2024-03-12 v1
摘要
我们提出了一种基于深度学习的方法,用于并发说话人检测 (CSD) 任务,该方法使用改进的 Transformer 模型。我们的模型旨在处理多麦克风数据,但也适用于单麦克风情况。该方法可将音频片段分类为三类之一:1) 无语音活动(仅噪声),2) 仅单个说话人活动,3) 多个说话人同时活动。我们在训练过程中引入了代价敏感 (CS) 损失和置信度校准。该方法在三个真实世界数据库(AMI、AliMeeting 和 CHiME 5)上进行了评估,结果表明其优于现有方法。
引用
@article{arxiv.2403.06856,
title = {Concurrent Speaker Detection: A multi-microphone Transformer-Based Approach},
author = {Amit Eliav and Sharon Gannot},
journal= {arXiv preprint arXiv:2403.06856},
year = {2024}
}
备注
5 pages, 6 tables, 2 figures