中文

基于离散唇部语义与多尺度全局-局部注意力的高效音视语音分离

声音 2026-03-12 v2 计算机视觉与模式识别

摘要

音视语音分离(AVSS)方法利用视觉线索来提取目标语音,在噪声声学环境中已显示出强大的分离质量。然而,这些方法通常涉及大量参数且计算成本高,在许多仅将语音分离作为进一步语音处理步骤的应用中难以接受。为解决此问题,我们提出一种高效AVSS方法,命名为Dolphin。对于视觉特征提取,我们开发了DP-LipCoder,一种双路径轻量级视频编码器,将唇部运动转换为离散的音频对齐语义标记。对于音频分离,我们构建一个轻量级编码器-解码器分离器,其中每一层都包含一个全局-局部注意力(GLA)块,以高效地捕获多尺度依赖关系。在三个基准数据集上的实验表明,Dolphin不仅在分离质量上超越了当前的最先进(SOTA)模型,还在效率方面实现了显著的改进:参数数量减少超过50%,计算复杂度(MACs)降低超过2.4倍,GPU推理速度提升超过6倍。这些结果表明,Dolphin为在实际场景中实现高性能AVSS提供了实用且可部署的解决方案。我们的代码和演示页面已公开 available at http://cslikai.cn/Dolphin/。

关键词

引用

@article{arxiv.2509.23610,
  title  = {Efficient Audio-Visual Speech Separation with Discrete Lip Semantics and Multi-Scale Global-Local Attention},
  author = {Kai Li and Kejun Gao and Xiaolin Hu},
  journal= {arXiv preprint arXiv:2509.23610},
  year   = {2026}
}

备注

Accepted to ICLR 2026