关于混合源 ECoG 信号的神经音素识别
音频与语音处理
2019-12-13 v1 神经与进化计算
声音
神经元与认知
摘要
利用皮层脑电(ECoG)的神经语音识别(NSR)这一新兴领域,近来因研究人脑如何在安静与噪声环境中识别语音而引起了显著的研究兴趣。在本研究中,我们展示了 NSR 系统用于客观证明人类在模拟鸡尾酒会场景中能够专注于单一语音源同时抑制干扰信号的能力。实验结果表明,在混合源场景下测试时,NSR 系统性能的相对退化显著低于自动语音识别(ASR)。在本文中,我们通过使用人工对齐进行初始化替代平坦启动技术,显著增强了我们近期发表框架的性能。我们还通过考虑声学与神经信号之间可能的转写不匹配,改进了 NSR 系统的性能。
引用
@article{arxiv.1912.05869,
title = {On Neural Phone Recognition of Mixed-Source ECoG Signals},
author = {Ahmed Hussen Abdelaziz and Shuo-Yiin Chang and Nelson Morgan and Erik Edwards and Dorothea Kolossa and Dan Ellis and David A. Moses and Edward F. Chang},
journal= {arXiv preprint arXiv:1912.05869},
year = {2019}
}
备注
5 pages, showing algorithms, results and references from our collaboration during a 2017 postdoc stay of the first author