中文

TIGER:面向高效语音分离的时间频率交错增益提取与重构

声音 2026-03-02 v3 人工智能 音频与语音处理

摘要

在近年,语音分离研究主要聚焦于提高模型性能。然而,对于低时延语音处理系统,高效性同样重要。因此,我们提出一种参数和计算成本显著降低的语音分离模型:时间频率交错增益提取与重构网络(TIGER)。TIGER 利用先验知识将频率带划分并压缩频率信息。我们采用多尺度选择性注意力模块提取语境特征,同时引入全频率帧注意力模块以捕获时频语境信息。此外,为更真实地评估语音分离模型在复杂声学环境中的性能,我们引入一个名为 EchoSet 的数据集。该数据集包含噪声和更真实的混响(例如,考虑物体遮挡和材料属性),语音来自两位说话人以随机比例重叠。实验结果表明,在 EchoSet 上训练的模型相较于其他数据集收集的物理世界数据,具有更好的泛化能力,验证了 EchoSet 的实际价值。在 EchoSet 和真实世界数据上,TIGER 参数数量降低了 94.3%,MACs 降低了 95.3%,同时实现了超越当前最先进(SOTA)模型 TF-GridNet 的性能。

关键词

引用

@article{arxiv.2410.01469,
  title  = {TIGER: Time-frequency Interleaved Gain Extraction and Reconstruction for Efficient Speech Separation},
  author = {Mohan Xu and Kai Li and Guo Chen and Xiaolin Hu},
  journal= {arXiv preprint arXiv:2410.01469},
  year   = {2026}
}

备注

Accepted by ICLR 2025, demo page: https://cslikai.cn/TIGER/