中文

重新思考利用预训练多层表征进行说话人验证

声音 2025-12-30 v1 人工智能

摘要

近期的说话人验证研究通过利用预训练Transformer模型的层级输出取得了显著进展,但鲜有人探索超越静态加权平均的多级特征聚合方法。我们提出了层注意力池化(Layer Attentive Pooling, LAP),一种全新的策略,用于聚合来自预训练语音模型的跨层表示,以用于说话人验证。LAP从多个时序角度评估每一层的重要性,并采用最大池化而非平均池化。此外,我们提出了由LAP和注意力统计时序池化(Attentive Statistical Temporal Pooling, ASTP)组成的轻量级后端说话人模型,用于从预训练模型输出中提取说话人嵌入。在VoxCeleb基准测试上进行实验,结果显示该紧凑架构实现了最先进的性能,同时大幅减少了训练时间。我们进一步分析了LAP设计及其动态加权机制在捕捉说话人特征方面的作用。

关键词

引用

@article{arxiv.2512.22148,
  title  = {Rethinking Leveraging Pre-Trained Multi-Layer Representations for Speaker Verification},
  author = {Jin Sob Kim and Hyun Joon Park and Wooseok Shin and Sung Won Han},
  journal= {arXiv preprint arXiv:2512.22148},
  year   = {2025}
}

备注

Accepted to Interspeech 2025