SincQDR-VAD:基于可学习滤波器和排序感知优化的噪声鲁棒语音活动检测框架
声音
2025-08-29 v1
摘要
语音活动检测(VAD)是语音驱动应用的必需功能,但在噪声和资源受限的环境中仍远非完美。现有方法往往缺乏对噪声的鲁棒性,且其帧级分类损失仅与VAD评估指标松散耦合。为解决这些挑战,我们提出SincQDR-VAD,一个紧凑且鲁棒的框架,结合Sinc提取器前端与新近的二次差异排序损失。Sinc提取器使用可学习的带通滤波器来捕获抗噪声的频谱特征,而排序损失优化语音帧与非语音帧之间的两两得分顺序,以提高受试者运行特征下面积(AUROC)。一系列在代表性基准数据集上的实验表明,我们的框架在AUROC和F2得分方面显著提高,同时仅使用约69%的参数即可实现,确认了其效率和实际可行性。
引用
@article{arxiv.2508.20885,
title = {SincQDR-VAD: A Noise-Robust Voice Activity Detection Framework Leveraging Learnable Filters and Ranking-Aware Optimization},
author = {Chien-Chun Wang and En-Lun Yu and Jeih-Weih Hung and Shih-Chieh Huang and Berlin Chen},
journal= {arXiv preprint arXiv:2508.20885},
year = {2025}
}
备注
Accepted to IEEE ASRU 2025