TFGA-Net:基于时频图注意力网络的脑控说话人提取
声音
2025-10-15 v1 人工智能
摘要
基于脑电图(EEG)信号的听觉注意力解码(AAD)技术的快速发展,为 EEG 驱动的目标说话人提取提供了可能。然而,如何有效利用 EEG 与语音之间的目标说话人共同信息,仍是一个未解决的问题。本文提出了一个脑控说话人提取模型,该模型利用来自听者的 EEG 记录来提取目标语音。为了有效提取 EEG 信号中的信息,我们推导出多尺度时频特征,并进一步融合在任务中被选择性参与的皮层拓扑结构。此外,为了充分利用融合后的 EEG 与语音特征,保留全局语境并捕获语音节奏与韵律,我们引入了 MossFormer2,该模型结合了 MossFormer 与 RNN-Free Recurrent 作为分离器。本文基于公开的 Cocktail Party 和 KUL 数据集的实验结果表明,我们的 TFGA-Net 模型在某些客观评估指标上显著优于最新方法。源代码已公开:https://github.com/LaoDa-X/TFGA-NET。
引用
@article{arxiv.2510.12275,
title = {TFGA-Net: Temporal-Frequency Graph Attention Network for Brain-Controlled Speaker Extraction},
author = {Youhao Si and Yuan Liao and Qiushi Han and Yuhang Yang and Rui Dai and Liya Huang},
journal= {arXiv preprint arXiv:2510.12275},
year = {2025}
}
备注
5 pages, 3 figures