中文

基于具脑样听觉特征生成模型从人脑活动重建声音

声音 2023-06-21 v1 人机交互 音频与语音处理

摘要

从人脑活动成功重建感知体验已为感官体验的神经表征提供了洞见。然而,由于声音中时间序列的复杂性以及神经成像模态分辨率的有限性,对任意声音进行重建一直被回避。为克服这些挑战,利用脑听觉处理的层次性可为重建任意声音提供路径。先前研究已指出人听觉系统与深度神经网络(DNN)模型间的层次同源性。此外,音频生成模型的进展使得将压缩表征转回高分辨率声音成为可能。本研究中,我们引入一种结合听觉特征脑解码与音频生成模型的新颖声音重建方法。利用对自然声音的 fMRI 响应,我们发现 DNN 模型的层次声音特征比谱时特征更易被解码。随后我们使用一个音频 transformer 重建声音,该 transformer 解纠缠了解码 DNN 特征中的压缩时间信息。我们的方法展示了对无约束声音的重建,捕捉了声音感知内容与质量,并通过重建未包含在训练数据集中的声音类别体现出泛化性。来自不同听觉区域的重建结果仍与实际声音相似,突显了听觉表征的分布式特性。为考察重建是否映射实际主观感知体验,我们进行了涉及对重叠声音中之一进行选择性听觉注意的实验。结果倾向于 resemble 被注意声音而非未被注意者。这些发现表明我们提出的模型提供了一种从人脑活动外化所经历听觉内容的手段。

关键词

引用

@article{arxiv.2306.11629,
  title  = {Sound reconstruction from human brain activity via a generative model with brain-like auditory features},
  author = {Jong-Yun Park and Mitsuaki Tsukamoto and Misato Tanaka and Yukiyasu Kamitani},
  journal= {arXiv preprint arXiv:2306.11629},
  year   = {2023}
}