面向说话人嵌入学习的传输导向特征聚合
音频与语音处理
2022-06-28 v1 声音
摘要
在说话人建模中,需要池化将帧级特征聚合成话语级表示。鉴于基于统计的池化方法的成功,我们假设说话人特征在预聚合层输出的统计分布中得到良好表示,并提议使用传输导向特征聚合来推导说话人嵌入。所聚合的表示编码了底层特征分布的几何结构,预期包含有价值的说话人特定信息,这些信息可能无法由均值和方差等常用统计度量表示。原始传输导向特征聚合还被扩展为加权帧版本以融入注意力机制。在 Voxceleb 数据集上的说话人验证实验显示其相对于统计池化及其注意力变体有所改进。
引用
@article{arxiv.2206.12857,
title = {Transport-Oriented Feature Aggregation for Speaker Embedding Learning},
author = {Yusheng Tian and Jingyu Li and Tan Lee},
journal= {arXiv preprint arXiv:2206.12857},
year = {2022}
}
备注
Accepted for presentation at INTERSPEECH 2022