中文

面向 ComParE 2022 口吃子挑战赛的端到端与自监督学习

声音 2022-07-25 v1 机器学习 音频与语音处理

摘要

在本文中,我们提出了以自监督方式训练的端到端及基于语音嵌入的系统,用于参加 ACM Multimedia 2022 ComParE 挑战赛,具体而言是口吃子挑战赛。特别地,我们利用预训练的 Wav2Vec2.0 模型在 KSoF 数据集上的嵌入来进行口吃检测(SD)。在提取嵌入后,我们使用多种方法对 SD 进行基准测试。我们提出的基于自监督的 SD 系统在验证集和测试集上分别取得了 36.9% 和 41.0% 的 UAR,分别比最佳(DeepSpectrum)挑战赛基线(CBL)高出 31.32%(验证集)和 1.49%(测试集)。此外,我们表明将层嵌入与梅尔频率倒谱系数(MFCCs)特征拼接,分别在验证集和测试集上比 CBL 进一步提升了 33.81% 和 5.45% 的 UAR。最后,我们证明对 Wav2Vec2.0 所有层的信息求和,分别在验证集和测试集上以 45.91% 和 5.69% 的相对幅度超越 CBL。Grand-challenge: Computational Paralinguistics ChallengE

关键词

引用

@article{arxiv.2207.10817,
  title  = {End-to-End and Self-Supervised Learning for ComParE 2022 Stuttering Sub-Challenge},
  author = {Shakeel Ahmad Sheikh and Md Sahidullah and Fabrice Hirsch and Slim Ouni},
  journal= {arXiv preprint arXiv:2207.10817},
  year   = {2022}
}

备注

Accepted in ACM MM 2022 Conference : Grand Challenges, "\c{opyright} {Owner/Author | ACM} {2022}. This is the author's version of the work. It is posted here for your personal use. Not for redistribution