中文

用于课堂语音检测的多尺度时间卷积网络

声音 2021-06-01 v1 音频与语音处理

摘要

由专家教师与助教协作教学,即所谓“双师课堂”(课程由专家在线讲授并通过投影屏幕在教室呈现,教室中的教师作为助教引导学生学习),在当今K-12教育方法中日益普及。为监控教学质量,常将麦克风夹在助教衣领处录制语音,随后送入自动语音识别(ASR)与神经语言处理(NLP)等下游任务。然而,除其语音外,还存在包括专家与学生语音在内的其他干扰声。在此,我们提出从声音事件检测的角度提取助教语音,即将语音分为四类:专家、教师、两者混合以及背景。为实现帧级识别(这对下游任务抓取敏感词十分重要),构建了多尺度时间卷积神经网络,采用堆叠空洞卷积以兼顾局部与全局特性。这些特征被拼接并送入由三个线性层构成的分类网络。该框架在模拟数据与真实录音上进行了评估,相较于若干经典分类方法,在精确率与召回率方面取得了可观性能。

关键词

引用

@article{arxiv.2105.14717,
  title  = {Multi-Scale Temporal Convolution Network for Classroom Voice Detection},
  author = {Lu Ma and Xintian Wang and Song Yang and Yaguang Gong and Zhongqin Wu},
  journal= {arXiv preprint arXiv:2105.14717},
  year   = {2021}
}

备注

5 pages, 2 figures, 1 table