中文

LSZone:面向车内多区域语音分离的轻量级空间信息建模架构

声音 2025-10-14 v1 人工智能

摘要

车内多区域语音分离能够捕获来自不同语音区域的语音,在人机交互中发挥着关键作用。虽然先前的SpatialNet 已取得显著成果,但其高计算成本仍阻碍了在车辆中实时应用。为此,本文提出LSZone,一种用于车内多区域语音分离的轻量级空间信息建模架构。我们设计了空间信息提取-压缩(SpaIEC)模块,将梅尔频谱和双耳相位差(IPD)相结合,以减少计算负担而又保持性能。此外,为高效建模空间信息,我们引入了极轻量级的卷积-GRU 跨带-窄带处理(CNP)模块。实验结果表明,LSZone 在复杂噪声和多说话者场景中性能卓越,其计算复杂度为0.56G MAC,实时因子(RTF)为0.37。

关键词

引用

@article{arxiv.2510.10687,
  title  = {LSZone: A Lightweight Spatial Information Modeling Architecture for Real-time In-car Multi-zone Speech Separation},
  author = {Jun Chen and Shichao Hu and Jiuxin Lin and Wenjie Li and Zihan Zhang and Xingchen Li and JinJiang Liu and Longshuai Xiao and Chao Weng and Lei Xie and Zhiyong Wu},
  journal= {arXiv preprint arXiv:2510.10687},
  year   = {2025}
}

备注

submitted to ICASSP 2026