基于脑电图与音频空间谱的注意力说话人方向多类解码
声音
2025-10-23 v2 人工智能
计算与语言
音频与语音处理
摘要
从听者的脑电图(EEG)信号中解码注意力说话人的方向焦点,对于开发脑机接口以改善听力障碍人士的生活质量至关重要。先前的工作集中于二元方向焦点解码,即判断注意力说话人位于听者的左侧还是右侧。然而,对于有效的语音处理,更精确地解码注意力说话人的确切方向是必要的。此外,音频空间信息尚未得到有效利用,导致解码结果不理想。本文发现,在最近提出的14类方向焦点数据集上,仅依赖EEG输入的模型在留一受试者和留一试验场景下解码方向焦点时准确率显著较低。通过将音频空间谱与EEG特征相结合,可以有效提高解码准确率。采用CNN、LSM-CNN和Deformer模型,从听者的EEG信号和音频空间谱中解码方向焦点。提出的Sp-EEG-Deformer模型在1秒决策窗口下,分别在留一受试者和留一试验场景中取得了55.35%和57.19%的显著14类解码准确率。实验结果表明,随着备选方向数量的减少,解码准确率提高。这些发现表明所提出的双模态方向焦点解码策略的有效性。
引用
@article{arxiv.2411.06928,
title = {Multi-class Decoding of Attended Speaker Direction Using Electroencephalogram and Audio Spatial Spectrum},
author = {Yuanming Zhang and Jing Lu and Fei Chen and Haoliang Du and Xia Gao and Zhibin Lin},
journal= {arXiv preprint arXiv:2411.06928},
year = {2025}
}
备注
Submitted to IEEE TNSRE