CochCeps-Augment:一种利用基于耳蜗倒谱掩蔽的自监督对比学习用于语音情感识别
音频与语音处理
2024-02-13 v1 机器学习
声音
信号处理
机器学习
摘要
针对情感内容进行自动语音识别的自监督学习(SSL)极易受噪声影响而产生严重退化,从而影响对语音复杂时间与频谱信息结构的建模效率。近期,针对大型语音数据集的 SSL,以及诸如时间和频率掩蔽等新的音频特定 SSL 代理任务相继出现,与源自图像增强领域的经典方法相比,展现出了更优的性能。我们提出的贡献建立在这一成功范式之上,引入了 CochCeps-Augment,这是一种用于语音表征自监督对比学习的全新仿生掩蔽增强任务。具体而言,我们利用新引入的仿生耳蜗倒谱图(CCGRAM)来推导输入语音的噪声鲁棒表征,随后通过自监督学习方案对其进行进一步优化。后者采用 SimCLR,通过掩蔽其角度和倒频率维度来生成 CCGRAM 的对比视图。我们的实验方法及在情感识别 K-EmoCon 基准数据集上的验证,首次通过说话人无关方法,涵盖了无监督预训练、线性探测和微调。我们的结果证明 CochCeps-Augment 有望成为语音情感识别分析的标准工具,展示了将仿生掩蔽作为自监督信息增强任务的附加价值。我们用于实现 CochCeps-Augment 的代码将发布于:https://github.com/GiannisZgs/CochCepsAugment。
引用
@article{arxiv.2402.06923,
title = {CochCeps-Augment: A Novel Self-Supervised Contrastive Learning Using Cochlear Cepstrum-based Masking for Speech Emotion Recognition},
author = {Ioannis Ziogas and Hessa Alfalahi and Ahsan H. Khandoker and Leontios J. Hadjileontiadis},
journal= {arXiv preprint arXiv:2402.06923},
year = {2024}
}
备注
5 pages, 1 figure Accepted in IEEE ICASSP 2024 Workshops - Self-Supervision in Audio, Speech, and Beyond