中文

EEG2Mel:从对音乐的大脑响应中重建声音

声音 2022-07-29 v1 计算机视觉与模式识别 信息检索 音频与语音处理

摘要

从对听觉与视觉刺激的大脑响应中进行信息检索,已通过分类呈现给被试并同时记录 EEG 信号时的歌曲名与图像类别取得成功。以重建听觉刺激形式的信息检索也取得了一定成功,但本文通过重建音乐刺激使其足以被独立感知与辨识,改进了以往方法。此外,深度学习模型在每对应一秒 EEG 记录窗口的时间对齐音乐刺激频谱上训练,与先前研究相比大幅减少了所需的特征提取步骤。使用被试被动聆听完整歌曲的 NMED-Tempo 与 NMED-Hindi 数据集训练并验证卷积神经网络(CNN)回归器。测试了原始电压与功率谱输入、线性与 mel 频谱图输出的效果,所有输入与输出均转换为 2D 图像。重建频谱图的质量通过训练分类器评估,结果显示 mel 频谱图准确率 81%、线性频谱图 72%(随机准确率 10%)。最后,在二选一匹配样本任务中,听者对重建听觉音乐刺激的辨别成功率为 85%(随机 50%)。

关键词

引用

@article{arxiv.2207.13845,
  title  = {EEG2Mel: Reconstructing Sound from Brain Responses to Music},
  author = {Adolfo G. Ramirez-Aristizabal and Chris Kello},
  journal= {arXiv preprint arXiv:2207.13845},
  year   = {2022}
}

备注

5 figures, 2 tables, listening examples and code provided