中文

基于咳嗽、笑声和“喂”的说话人识别

声音 2017-06-27 v1 计算与语言

摘要

本文提出了一项利用琐碎语音事件(如咳嗽和笑声)的说话人识别 (SRE) 任务。这些琐碎事件在对话中无处不在,且较少受到主观意图改变的影响,因此为从伪装语音中发现真实说话人提供了有价值的特征。然而,琐碎事件通常很短且频谱模式独特,使得 SRE 极其困难。幸运的是,我们发现了一种非常强大的深度特征学习结构,能够提取高度敏感于说话人的特征。利用这一工具,我们研究了三种琐碎事件上的 SRE 性能:咳嗽、笑声和“喂”(一种简短的中文“你好”)。结果表明,在这些琐碎事件中蕴含着丰富的说话人信息,即使是直觉上较难区分说话人的咳嗽也是如此。采用深度特征方法,尽管这三种琐碎事件的持续时间极短(0.2-1.0 秒),其等错误率 (EER) 仍可达到 10%-14%。

关键词

引用

@article{arxiv.1706.07860,
  title  = {Speaker Recognition with Cough, Laugh and "Wei"},
  author = {Miao Zhang and Yixiang Chen and Lantian Li and Dong Wang},
  journal= {arXiv preprint arXiv:1706.07860},
  year   = {2017}
}