面向边缘设备实时处理的两阶段视听目标说话人提取系统
声音
2025-11-13 v2 音频与语音处理
摘要
视听目标说话人提取(AVTSE)旨在以视觉信息为辅助,在多说话人环境中分离出目标说话人的声音。现有的AVTSE方法大多同时编码视觉和音频特征,导致计算复杂度极高,使其无法在边缘设备上进行实时处理。为了解决这个问题,我们提出了一种两阶段超紧凑AVTSE系统。具体而言,在第一阶段,采用紧凑网络利用视觉信息进行语音活动检测(VAD)。在第二阶段,将VAD结果与音频输入相结合,以分离目标说话人的声音。实验表明,所提出的系统能够有效抑制背景噪声和干扰语音,同时消耗很少的计算资源。
引用
@article{arxiv.2505.22229,
title = {Two-stage Audio-Visual Target Speaker Extraction System for Real-Time Processing On Edge Device},
author = {Zixuan Li and Xueliang Zhang and Lei Miao and Zhipeng Yan and Ying Sun and Chong Zhu},
journal= {arXiv preprint arXiv:2505.22229},
year = {2025}
}