中文

基于时频注意力缓存记忆模型的实时语音分离

声音 2025-05-20 v1 人工智能 音频与语音处理

摘要

现有的因果语音分离模型常因难以保留历史信息而不如非因果模型。为此,我们提出了时频注意力缓存记忆模型(TFACM),通过注意力机制和缓存记忆(CM)有效捕获时空关系,用于历史信息存储。在TFACM中,LSTM层捕获频率相对位置,而对时间维度应用局部和全局表示进行因果建模。CM模块存储过去信息,因果注意力细化(CAR)模块进一步增强时间维度的特征表示,以获得更细粒度的特征。实验结果表明,TFACM在性能上与SOTA TF-GridNet-Causal模型相当,但复杂度显著降低,参数数量更少。详情请访问项目页面:https://cslikai.cn/TFACM/。

关键词

引用

@article{arxiv.2505.13094,
  title  = {Time-Frequency-Based Attention Cache Memory Model for Real-Time Speech Separation},
  author = {Guo Chen and Kai Li and Runxuan Yang and Xiaolin Hu},
  journal= {arXiv preprint arXiv:2505.13094},
  year   = {2025}
}