中文

Plug-and-Steer:解耦音视频目标说话人提取中的分离与选择

音频与语音处理 2026-03-23 v1 多媒体 声音

摘要

本文旨在通过解耦分离与目标选择,为音视频目标说话人提取(AV-TSE)提供新视角。传统 AV-TSE 系统通常深度集成音频和视觉特征,以重新学习整个分离过程,这会因户外噪声音视频数据集的噪声特性而形成性能上限。为此,我们提出 Plug-and-Steer 方法,将高保真度分离分配给冻结的音频-only 主干网络,并严格限制视觉模态的作用仅限于目标选择。我们引入潜在驾驶矩阵(LSM),这是一种极简的线性变换,用于在主干网络内部重新路由潜在特征,将目标说话人锚定到指定通道。跨四个代表性架构的实验表明,本方法有效保留了各类主干网络的声学先验,实现的感知质量与原始主干相当。音频样本可在:https://plugandsteer.github.io 访问。

关键词

引用

@article{arxiv.2603.19697,
  title  = {Plug-and-Steer: Decoupling Separation and Selection in Audio-Visual Target Speaker Extraction},
  author = {Doyeop Kwak and Suyeon Lee and Joon Son Chung},
  journal= {arXiv preprint arXiv:2603.19697},
  year   = {2026}
}

备注

Submitted to Interspeech 2026; demo available https://plugandsteer.github.io