中文

基于窗化 Sink 注意力的高效人声源分离

声音 2025-10-30 v1

摘要

像 Mel-Band-Roformer 这样的前沿人声分离模型依赖全时序自注意力机制,其中每个时序帧与所有其他帧进行交互。这导致计算成本随输入音频长度呈二次增长,促使采用分块和窗化方法。通过分析预训练的人声分离模型,我们发现时序注意力模式高度局部化。基于这一洞察,我们用小时序注意力窗口和注意力沉淀(attention sinks)取代全注意力,形成窗化 Sink 注意力(windowed sink attention,WSA)。我们实证表明,从原始检查点进行微调即可在保留 92% 原有 SDR 性能的同时,将 FLOPs 降低 44.5 倍。我们在 MIT 许可下发布代码和模型检查点,地址为 https://github.com/smulelabs/windowed-roformer。

关键词

引用

@article{arxiv.2510.25745,
  title  = {Efficient Vocal Source Separation Through Windowed Sink Attention},
  author = {Christodoulos Benetatos and Yongyi Zang and Randal Leistikow},
  journal= {arXiv preprint arXiv:2510.25745},
  year   = {2025}
}