说话人嵌入感知神经日记化:一种用于会议场景重叠语音日记化的高效框架
声音
2022-04-01 v2 机器学习
多媒体
音频与语音处理
摘要
重叠语音日记化传统上被当作多标签分类问题处理。在本文中,我们通过利用幂集将多个二值标签编码为单一标签(表示目标说话人的可能组合),将该任务重新表述为单标签预测问题。这种表述有两个好处。首先,目标说话人的重叠被显式建模。其次,不再需要阈值选择。通过这一表述,我们提出了说话人嵌入感知神经日记化(SEND)框架,其中语音编码器、说话人编码器、两个相似度打分器和一个后处理网络被联合优化,以根据语音特征与说话人嵌入之间的相似度预测编码标签。实验结果表明,SEND 具有稳定的学习过程,并能在高度重叠的数据上训练而无需额外初始化。更重要的是,我们的方法以更少的模型参数和更低的计算复杂度,在真实会议场景中取得了最先进(SOTA)性能。
引用
@article{arxiv.2203.09767,
title = {Speaker Embedding-aware Neural Diarization: an Efficient Framework for Overlapping Speech Diarization in Meeting Scenarios},
author = {Zhihao Du and Shiliang Zhang and Siqi Zheng and Zhijie Yan},
journal= {arXiv preprint arXiv:2203.09767},
year = {2022}
}
备注
Submitted to INTERSPEECH 2022, 5 parges, 2 figure