CLIP-VAD:利用视觉-语言模型进行语音活动检测
计算机视觉与模式识别
2024-10-21 v1
摘要
语音活动检测(VAD)是自动确定某人是否在说话以及识别其语音时机的过程,通常通过处理音频信号或视觉数据,或通过融合或联合学习两种模态来实现。本研究受近期视觉-语言模型进展的启发,提出一种新方法,利用对比语言-图像预训练(CLIP)模型。CLIP视觉编码器分析由个体上身构成的视频片段,而文本编码器处理通过提示工程自动生成的文本描述。随后,通过深度神经网络融合这些编码器的嵌入向量,以完成VAD。我们的实验在三个VAD基准数据集上表明,本方法在现有视觉VAD方法中表现优异。值得注意的是,尽管本方法简单却超过了多个音频-视觉方法,且无需在大规模音频-视觉数据集上进行预训练。
引用
@article{arxiv.2410.14509,
title = {CLIP-VAD: Exploiting Vision-Language Models for Voice Activity Detection},
author = {Andrea Appiani and Cigdem Beyan},
journal= {arXiv preprint arXiv:2410.14509},
year = {2024}
}