从粗到细:基于递归语义增强的音视频语义提升语音分离
声音
2025-10-13 v2
摘要
音视频语音分离旨在通过利用视觉线索(如唇部动作和面部特征)从混合信号中分离出每个说话者的干净语音。虽然视觉信息提供了补充的语义指导,但现有方法往往未充分发挥其潜力,因其依赖静态视觉表示。本文提出了 CSFNet,即一种粗到细网络,通过引入递归语义增强范式实现更有效的分离。CSFNet 在两个阶段运行:(1)粗糙分离,首先-pass 估计从混合信号和视觉输入重构粗糙音频波形;(2)细化分离,将粗糙音频输入音视频语音识别(AVSR)模型,同时保留视觉流。这种递归过程产生更具辨识度的语义表示,然后用于提取精炼后的音频。为进一步利用这些语义,我们设计了说话者感知的感知融合模块,用于跨模态编码说话者身份,并设计了多范围时频分离网络以捕获局部和全局时频模式。在三个基准数据集和两个噪声数据集上的大量实验表明,CSFNet 实现了最先进(SOTA)性能,显著的粗到细改进验证了我们递归语义增强框架的必要性与有效性。
引用
@article{arxiv.2509.22425,
title = {From Coarse to Fine: Recursive Audio-Visual Semantic Enhancement for Speech Separation},
author = {Ke Xue and Rongfei Fan and Lixin and Dawei Zhao and Chao Zhu and Han Hu},
journal= {arXiv preprint arXiv:2509.22425},
year = {2025}
}