基于二维自注意力嵌入组合的说话人日志方法
计算与语言
2019-02-11 v1 机器学习
声音
音频与语音处理
摘要
说话人日志系统常使用 i-vector 和 d-vector 等说话人嵌入对音频片段进行聚类。由于不同类型的嵌入往往具有互补性,本文提出一种通用框架,通过将它们组合为单一嵌入(称为 c-vector)来提升性能。该组合采用二维(2D)自注意力结构,其扩展了标准自注意力层,不仅沿时间维度平均,还沿不同嵌入类型维度平均。本文中的两种二维自注意力结构分别为同时组合与连续组合,分别采用单层与多层自注意力层。原始自注意力层中作为惩罚项与目标函数联合最小化以促使标注向量多样性的项也被修改,从而在多个标注向量中不仅获得不同的局部峰值,还获得整体趋势。在 AMI 会议语料库上的实验表明,我们修改后的惩罚项使 d-vector 系统的相对说话人错误率(SER)分别降低 6% 和 21%,而使用我们最佳二维自注意力结构得到的 c-vector 可进一步使相对 SER 降低 10%。
引用
@article{arxiv.1902.03190,
title = {Speaker diarisation using 2D self-attentive combination of embeddings},
author = {Guangzhi Sun and Chao Zhang and Phil Woodland},
journal= {arXiv preprint arXiv:1902.03190},
year = {2019}
}
备注
ICASSP 2019