HyWA:面向个人化语音活动检测的超网络权重适配
音频与语音处理
2026-03-12 v2 人工智能
机器学习
声音
摘要
个人化语音活动检测(PVAD)系统仅在响应特定目标说话人时才会激活。通常会采用说话人条件化方法将有关目标说话人的信 information 注入VAD管道,以实现个性化。现有的说话人条件化方法通常修改VAD模型的输入或激活。我们提出了另一种说话人条件化视角。我们的方法HyWA采用超网络为标准VAD模型的若干选定层生成个人化权重。我们使用固定主干VAD对HyWA与多种基线说话人条件化技术进行评估。我们的比较表明,PVAD性能得到了持续的改善。这一新方法以两种方式改进了当前的说话人条件化技术:i)提高平均精度,ii)通过复用相同的VAD架构简化部署。
引用
@article{arxiv.2510.12947,
title = {HyWA: Hypernetwork Weight Adapting Personalized Voice Activity Detection},
author = {Mahsa Ghazvini Nejad and Hamed Jafarzadeh Asl and Amin Edraki and Mohammadreza Sadeghi and Masoud Asgharian and Yuanhao Yu and Vahid Partovi Nia},
journal= {arXiv preprint arXiv:2510.12947},
year = {2026}
}
备注
Mahsa Ghazvini Nejad and Hamed Jafarzadeh Asl contributed equally to this work. Submitted to Interspeech 2026