中文

基于预训练模型与多分辨率编码器的短片段说话人验证

音频与语音处理 2026-01-28 v2

摘要

利用通过自监督学习预训练的模型提取特征的说话人验证(SV)近期已展现出令人瞩目的性能。然而,这些预训练模型(PTM)通常具有 20 ms 的时间分辨率,低于典型的滤波器组特征。这在输入片段短于 2 秒的短片段 SV 中可能尤为成问题,因为在这种情况下我们需要从有限长度的输入中提取尽可能多的信息。尽管已有方法利用 HuBERT 模型的多分辨率特征,但当采样率为 16 kHz 时窗口偏移分别为 20、40 和 100 ms,因此仅考虑了较低分辨率的特征。在本研究中,我们提出了一种 SV 系统,该系统利用 PTM 特征以及滤波器组特征和多分辨率时域编码器的特征,其窗口偏移分别为 1.56、3.13、6.25 和 12.5 ms。在 VoxCeleb 数据集上进行的不同输入长度实验表明,与各种输入特征组合的系统相比,本方法具有一致性的提升。

关键词

引用

@article{arxiv.2509.19721,
  title  = {Short-Segment Speaker Verification with Pre-trained Models and Multi-Resolution Encoder},
  author = {Jisoo Myoung and Sangwook Han and Kihyuk Kim and Jong Won Shin},
  journal= {arXiv preprint arXiv:2509.19721},
  year   = {2026}
}

备注

Accepted to ICASSP 2026