中文

自然语音中可错觉化样本的惊人密度

声音 2019-08-20 v3 计算与语言 机器学习 音频与语音处理 机器学习

摘要

近期关于对抗样本的研究表明,大多数自然输入可被扰动以欺骗即便是最先进的机器学习系统。但这是否也会发生在人类身上?在这项工作中,我们研究:自然语音中有多大比例的自然实例可被转化为“错觉”,从而改变人类感知或导致不同人群产生显著不同的感知?我们首先考虑麦格克效应(McGurk effect),即通过在音频通道添加精心选择的视频片段来影响观看者对所说内容的感知的现象(McGurk and MacDonald, 1976)。我们获得经验估计,自然语音中出现的大量单词和句子对该效应具有一定易感性。我们还学习了预测麦格克错觉化的模型。最后,我们证明了 Yanny 或 Laurel 听觉错觉(Pressnitzer et al., 2018)并非孤立事件,通过生成若干非常不同的新实例加以展示。我们认为,自然语音中可错觉化样本的惊人密度值得从安全与认知科学两个视角进一步研究。补充视频见:https://www.youtube.com/playlist?list=PLaX7t1K-e_fF2iaenoKznCatm0RC37B_k。

关键词

引用

@article{arxiv.1906.01040,
  title  = {A Surprising Density of Illusionable Natural Speech},
  author = {Melody Y. Guan and Gregory Valiant},
  journal= {arXiv preprint arXiv:1906.01040},
  year   = {2019}
}

备注

CogSci 2019