用于直播音乐视频流中音视频语音活动检测的规则嵌入网络
声音
2020-11-03 v2 多媒体
音频与语音处理
摘要
在直播音乐流中检测主播语音是音乐与语音信号处理的重要预处理环节。现有语音活动检测(VAD)方法主要依赖音频,然而基于音频的 VAD 难以在噪声环境中有效聚焦于目标语音。借助视觉信息,本文提出一种规则嵌入网络来融合音视频(A-V)输入,以帮助模型更好地检测目标语音。该规则在模型中的核心作用是协调双模态信息之间的关系,并利用视觉表征作为掩码过滤非目标声音的信息。实验表明:1)在所提规则跨模态融合的辅助下,A-V 分支的检测结果优于音频分支;2)双模态模型的性能远优于仅音频模型,表明音频与视觉信号的结合对 VAD 极为有益。为吸引更多对跨模态音乐与音频信号处理的关注,本文引入了一个带帧级标注的直播音乐视频语料库。
引用
@article{arxiv.2010.14168,
title = {Rule-embedded network for audio-visual voice activity detection in live musical video streams},
author = {Yuanbo Hou and Yi Deng and Bilei Zhu and Zejun Ma and Dick Botteldooren},
journal= {arXiv preprint arXiv:2010.14168},
year = {2020}
}
备注
Submitted to ICASSP 2021