中文

用于认知与体力负荷下语音分析的手工与可学习混合音频表征

声音 2022-10-26 v2 人工智能 机器学习 音频与语音处理

摘要

作为对威胁或不利条件的神经生理反应,压力会影响认知、情绪和行为,若持续暴露可能对健康产生有害影响。由于语音的情感内容本质上受个体身心状态调制,大量研究致力于探讨引发压力的任务负荷的副语言相关特征。历史上,语音压力分析(VSA)一直使用传统的数字信号处理(DSP)技术进行。尽管基于深度神经网络(DNN)的现代方法已有发展,但由于压力源种类繁多且个体压力感知差异显著,准确检测语音中的压力仍然困难。为此,我们引入了五个用于语音任务负荷检测的数据集。语音录音在志愿者群体中诱发认知或体力压力时采集,说话人累计超过百名。我们利用这些数据集设计并评估了一种新颖的自监督音频表征,其结合了手工特征(基于DSP)的有效性与数据驱动的DNN表征的复杂性。值得注意的是,所提方法优于广泛的手工特征集和新颖的基于DNN的音频表征学习方法。

关键词

引用

@article{arxiv.2203.16637,
  title  = {Hybrid Handcrafted and Learnable Audio Representation for Analysis of Speech Under Cognitive and Physical Load},
  author = {Gasser Elbanna and Alice Biryukov and Neil Scheidwasser-Clow and Lara Orlandic and Pablo Mainar and Mikolaj Kegler and Pierre Beckmann and Milos Cernak},
  journal= {arXiv preprint arXiv:2203.16637},
  year   = {2022}
}

备注

Submitted to InterSpeech 2022