注意力并非总是最优解:通过简单特征融合优化语音活动检测
声音
2025-06-03 v1 计算与语言
音频与语音处理
摘要
语音活动检测(VAD)在语音处理中扮演着关键角色,通常利用手工特征或神经特征。本研究考察了 Mel 频率倒谱系数(MFCCs)与预训练模型(PTM)特征的有效性,包括 wav2vec 2.0、HuBERT、WavLM、UniSpeech、MMS 和 Whisper。我们提出了 FusionVAD,这是一个结合上述两种特征类型的统一框架,采用三种融合策略:拼接、相加和交叉注意力(CA)。实验结果表明,简单的融合技术(尤其是相加)在准确性和效率上均优于 CA。基于融合的模型持续超越单特征模型,突显了 MFCCs 与 PTM 特征的互补性。值得注意的是,我们表现最好的融合模型在多个数据集上超越了 SOTA 模型 Pyannote,实现了 2.04% 的绝对平均提升。这些结果证实,简单的特征融合在保持计算效率的同时增强了 VAD 的鲁棒性。
引用
@article{arxiv.2506.01365,
title = {Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion},
author = {Kumud Tripathi and Chowdam Venkata Kumar and Pankaj Wasnik},
journal= {arXiv preprint arXiv:2506.01365},
year = {2025}
}
备注
Accepted at INTERSPEECH 2025, 5 pages, 4 figures, 2 tables