从脑电信号解码说话人归一化基频用于汉语感知
声音
2025-05-27 v1 音频与语音处理
摘要
不同说话人发出的相同语音内容在基频轮廓上表现出显著差异,然而听者的语义感知却不受影响。这种现象可能源于大脑对基频轮廓的感知独立于个体说话人的基频范围。在本研究中,我们记录了参与者在聆听具有不同声调、音素和说话人的汉语单音节时的脑电信号(EEG)。我们提出了 CE-ViViT 模型,直接从 EEG 解码原始或说话人归一化的基频轮廓。实验结果表明,所提出的模型能够以适度的误差解码基频轮廓,取得了与 SOTA EEG 回归方法相当的性能。此外,说话人归一化的基频轮廓被更准确地解码,支持了相对基频的神经编码。
引用
@article{arxiv.2505.19626,
title = {Decoding Speaker-Normalized Pitch from EEG for Mandarin Perception},
author = {Jiaxin Chen and Yiming Wang and Ziyu Zhang and Jiayang Han and Yin-Long Liu and Rui Feng and Xiuyuan Liang and Zhen-Hua Ling and Jiahong Yuan},
journal= {arXiv preprint arXiv:2505.19626},
year = {2025}
}