用于说话人日记化的高分辨率嵌入提取器
声音
2022-11-09 v1 计算与语言
音频与语音处理
摘要
说话人嵌入提取器显著影响基于聚类的说话人日记化系统的性能。 conventionally,从每个语音段仅提取一个嵌入。然而,由于滑动窗方法,一段语音易因说话人变更点而包含两名或更多说话人。本研究提出一种新颖的嵌入提取器架构,称为高分辨率嵌入提取器(HEE),其从每个语音段提取多个高分辨率嵌入。Hee由特征图提取器与增强器组成,其中带自注意力机制的增强器是成功关键。HEE的增强器替代了聚合过程;增强器并非全局池化层,而是借助注意力利用全局上下文将相对信息结合至各帧。提取的稠密帧级嵌入可各自代表一名说话人。因此,多名说话人可由各段中不同帧级特征表示。我们还提出一种人工生成混合数据训练框架以训练所提HEE。通过在五个评测集(含四个公开数据集)上的实验,所提HEE在除一个数据集外的每个评测集上均展现出至少10%的提升,我们分析了该数据集快速说话人变更较少存在。
引用
@article{arxiv.2211.04060,
title = {High-resolution embedding extractor for speaker diarisation},
author = {Hee-Soo Heo and Youngki Kwon and Bong-Jin Lee and You Jin Kim and Jee-weon Jung},
journal= {arXiv preprint arXiv:2211.04060},
year = {2022}
}
备注
5pages, 2 figure, 3 tables, submitted to ICASSP