探索基于 Transformer 的语音增强中的长度泛化
超导电性
2025-06-10 v1
摘要
Transformer 网络架构在语音增强中已证明有效。然而,作为其核心模块,自注意力机制的二次复杂度使得针对长语音utterance进行训练难以实现。在实际场景中,语音增强模型常需在运行时处理远长于训练utterance的噪声语音。如何使基于 Transformer 的语音增强模型能够泛化至长语音utterance仍是挑战。本文开展了大量经验研究,以探索模型的长度泛化能力。具体而言,我们在四种训练目标上进行语音增强实验,并用五个指标进行评估。我们的研究表明,位置编码是有效抑制语音增强中utterance长度影响的工具。我们首先探索了几种现有的定位编码方法,结果显示相对位置编码方法在长度泛化方面优于绝对位置编码方法。此外,我们还探索了一种更简单且更有效的定位编码方案,即 LearnLin——该方案仅为每个注意力头使用一个可训练参数来缩放时间帧之间的实际相对位置,从而学习这些头对短期或长期依赖性的不同偏好。结果表明,我们的方案在相当或更优于其他最先进定位编码策略的性能下,展现出卓越的长度泛化能力。
关键词
引用
@article{arxiv.2506.06696,
title = {Intertwined nematic and d-wave superconductive orders in optimally-doped La1.84Sr0.16CuO4},
author = {Gangfan Chen and Yichi Zhang and Guangyu Xi and Jingyi Shen and Jie Wu},
journal= {arXiv preprint arXiv:2506.06696},
year = {2025}
}