中文

SpeechFormer++:一种用于副语言语音处理的分层高效框架

音频与语音处理 2023-03-01 v1 计算与语言 声音

摘要

副语言语音处理在解决诸多问题(如情感与神经认知障碍分析)中十分重要。近来,Transformer 在自然语言处理领域取得显著成功,并展现出对语音的适应性。然而,先前语音领域关于 Transformer 的工作未结合语音特性,使其全部潜力未被发掘。本文考虑语音特征,提出一种基于通用结构的框架 SpeechFormer++,用于副语言语音处理。更具体地,遵循语音信号中的成分关系,我们设计单元编码器以高效建模单元内与单元间信息(即帧、音素与词)。依据分层关系,我们利用合并块生成不同粒度的特征,这与语音信号中的结构模式一致。此外,引入词编码器将词粒度特征整合进每个单元编码器,有效平衡细粒度与粗粒度信息。SpeechFormer++ 在语音情感识别(IEMOCAP 与 MELD)、抑郁分类(DAIC-WOZ)和阿尔茨海默病检测(Pitt)任务上评估。结果显示 SpeechFormer++ 优于标准 Transformer,同时大幅降低计算成本。此外,其相比最先进方法取得了更优结果。

关键词

引用

@article{arxiv.2302.14638,
  title  = {SpeechFormer++: A Hierarchical Efficient Framework for Paralinguistic Speech Processing},
  author = {Weidong Chen and Xiaofen Xing and Xiangmin Xu and Jianxin Pang and Lan Du},
  journal= {arXiv preprint arXiv:2302.14638},
  year   = {2023}
}

备注

14 pages, 7 figures, 14 tables, TASLP 2023 paper