面向短录音说话人嵌入的自适应说话人嵌入自增强策略
音频与语音处理
2026-01-21 v1
摘要
个人语音活动检测(PVAD)对于识别混合语中的目标说话人片段至关重要,但其性能严重依赖于说话人嵌入的质量。一个关键实用限制是短录音说话人——例如唤醒词——只提供有限的线索。本文提出了一种新的自适应说话人嵌入自增强策略,通过对从混合语中提取的关键帧嵌入进行加法融合来增强 PVAD 的性能。此外,我们引入长期适应策略以在检测期间迭代细化嵌入,减轻说话人时间变异性。实验表明,在短录音条件下,召回率、精确率和 F1 分数均实现了显著提升,经过五次迭代后即可匹配完整录音的性能。源代码已提供,访问 https://anonymous.4open.science/r/ASE-PVAD-E5D6。
引用
@article{arxiv.2601.12769,
title = {Adaptive Speaker Embedding Self-Augmentation for Personal Voice Activity Detection with Short Enrollment Speech},
author = {Fuyuan Feng and Wenbin Zhang and Yu Gao and Longting Xu and Xiaofeng Mou and Yi Xu},
journal= {arXiv preprint arXiv:2601.12769},
year = {2026}
}
备注
Accepted by ICASSP 2026