DWFormer:用于语音情感识别的动态窗口 Transformer
声音
2023-03-06 v1 计算与语言
音频与语音处理
摘要
语音情感识别对人机交互至关重要。表征不同情感的时间区域分散在语音的不同局部位置。此外,重要信息的时间尺度在语音段内与跨语音段间可能差异巨大。尽管基于 transformer 的模型已在该领域取得进展,现有模型仍无法在不同时间尺度上精确定位重要区域。为解决此问题,我们提出动态窗口 Transformer (DWFormer),一种通过动态将样本切分为窗口来利用时间重要性的新架构。在窗口内应用自注意力机制,以细粒度方式局部捕获时间重要信息。跨窗口信息交互亦被考虑以实现全局通信。DWFormer 在 IEMOCAP 与 MELD 数据集上进行了评估。实验结果表明,所提模型取得了优于先前最优方法的性能。
引用
@article{arxiv.2303.01694,
title = {DWFormer: Dynamic Window transFormer for Speech Emotion Recognition},
author = {Shuaiqi Chen and Xiaofen Xing and Weibin Zhang and Weidong Chen and Xiangmin Xu},
journal= {arXiv preprint arXiv:2303.01694},
year = {2023}
}
备注
4 pages, 5 figures, 3 tables, accepted by 2023 International Conference on Acoustics, Speech, and Signal Processing (ICASSP2023)