基于时频注意力缓存记忆模型的实时语音分离
声音
2025-05-20 v1 人工智能
音频与语音处理
摘要
现有的因果语音分离模型常因难以保留历史信息而不如非因果模型。为此,我们提出了时频注意力缓存记忆模型(TFACM),通过注意力机制和缓存记忆(CM)有效捕获时空关系,用于历史信息存储。在TFACM中,LSTM层捕获频率相对位置,而对时间维度应用局部和全局表示进行因果建模。CM模块存储过去信息,因果注意力细化(CAR)模块进一步增强时间维度的特征表示,以获得更细粒度的特征。实验结果表明,TFACM在性能上与SOTA TF-GridNet-Causal模型相当,但复杂度显著降低,参数数量更少。详情请访问项目页面:https://cslikai.cn/TFACM/。
引用
@article{arxiv.2505.13094,
title = {Time-Frequency-Based Attention Cache Memory Model for Real-Time Speech Separation},
author = {Guo Chen and Kai Li and Runxuan Yang and Xiaolin Hu},
journal= {arXiv preprint arXiv:2505.13094},
year = {2025}
}