中文

RISC:用于喊叫类型分类与喊叫强度预测的语料库

声音 2024-10-22 v2 音频与语音处理

摘要

喊叫语音的检测在音频监控与监测中至关重要。尽管安全系统能够识别紧急情况是理想的,但现有语料库仅为每个语音样本提供二值标签(即喊叫或正常),难以预测喊叫强度。此外,大多数语料库仅包含典型危险情境下的话语,意味着分类器无法学会将此类话语与较不危险情境(如欢呼)中的典型喊叫区分开来。因此,本文提出一个新的研究资源——立命馆喊叫语料库(RItsumeikan Shout Corpus, RISC),其包含在录音实验中收集的多种类型喊叫语音样本。RISC中每个喊叫语音样本均具有喊叫类型,并通过众包服务赋予喊叫强度评分。我们还给出了用于语音类型分类任务与喊叫强度预测任务的深度学习方法之间的综合性能比较。结果表明,基于谱域与倒谱域的特征学习无论使用何种网络架构均取得高性能。结果也表明喊叫类型分类与强度预测仍是具有挑战性的任务,RISC有望推动该研究领域的进一步发展。

关键词

引用

@article{arxiv.2306.04143,
  title  = {RISC: A Corpus for Shout Type Classification and Shout Intensity Prediction},
  author = {Takahiro Fukumori and Taito Ishida and Yoichi Yamashita},
  journal= {arXiv preprint arXiv:2306.04143},
  year   = {2024}
}

备注

This paper has been accepted for publication in IEEE/ACM Transactions on Audio, Speech, and Language Processing. DOI: 10.1109/TASLP.2024.3473302