中文

ReDimNet2:通过时间池化维度重塑扩展说话人验证

音频与语音处理 2026-03-13 v1

摘要

我们提出 ReDimNet2,这是一种改进的神经网络架构,用于提取说话人级表示,建立在 ReDimNet 维度重塑框架之上。ReDimNet2 的关键修改是引入在 1D 处理路径中对时间维度进行池化操作。这一操作保留了 1D 特征空间的本质,因为无论时间分辨率如何,1D 特征仍然是 2D 特征的重塑版本,同时实现了在不按比例增加计算量的前提下显著更激进地扩展通道维度。我们引入了 7 种模型配置 (B0-B6),参数数量从 110 万到 1230 万,GMACS 从 0.33 到 13。在 VoxCeleb1 数据集上进行的实验结果表明,ReDimNet2 在每一个规模节点上相对于 ReDimNet 在计算成本与准确率的帕累托前沿上都有所改进,在 1230 万参数和 13 GMACS 的情况下实现了 0.287% 的 EER。

关键词

引用

@article{arxiv.2603.11841,
  title  = {ReDimNet2: Scaling Speaker Verification via Time-Pooled Dimension Reshaping},
  author = {Ivan Yakovlev and Anton Okhotnikov},
  journal= {arXiv preprint arXiv:2603.11841},
  year   = {2026}
}

备注

Submitted to Interspeech 2026