说话人识别的重塑维度网络
音频与语音处理
2024-09-26 v2
摘要
本文提出 Reshape Dimensions Network(ReDimNet),一种用于提取说话人片段表示的新型神经网络架构。我们的方法利用2D 特征图与1D 信号表示之间的维度重塑,实现了1D 和2D 块的联合使用。我们提出一种原始网络拓扑,保持1D 和2D 块的通道-时间-频率输出体积,实现高效的残差特征图聚合。此外,ReDimNet 具有良好的可扩展性,我们引入了从1000万参数到1500万参数、从0.5到20 GMACs 的多种模型规模。我们的实验结果表明,ReDimNet 在说话人识别任务中实现了状态的最佳性能,同时降低了计算复杂度和模型参数数量。
引用
@article{arxiv.2407.18223,
title = {Reshape Dimensions Network for Speaker Recognition},
author = {Ivan Yakovlev and Rostislav Makarov and Andrei Balykin and Pavel Malov and Anton Okhotnikov and Nikita Torgashov},
journal= {arXiv preprint arXiv:2407.18223},
year = {2024}
}
备注
Proceedings of Interspeech