中文

CA-TCN: 用于直接听觉注意力解码的因果-反因果时序卷积网络

声音 2026-03-30 v1

摘要

在复杂聆听环境中引导听觉注意力的一种有前景的方法依赖于听觉注意力解码(AAD),其目标是从神经记录中识别多说话人场景中被关注的语音流。基于同步化的AAD方法通常假设可以获取干净的语音源和脑电图(EEG)信号,以利用神经响应与所关注刺激之间的低频相关性。在本研究中,我们提出了CA-TCN,一种用于直接分类被关注说话人的因果-反因果时序卷积网络。所提出的架构集成了序列处理任务中卷积神经网络的多种最佳实践。重要的是,它通过分别采用因果卷积和反因果卷积来显式对齐听觉刺激与神经响应,二者具有不同的感受野并在相反的时间方向上运作。通过与三个基线AAD模型的对比实验结果表明,CA-TCN在各数据集和决策窗口上持续提升了解码准确率,对于无受试者模型,准确率提升幅度为0.5%至3.2%,对于有受试者模型,提升幅度为0.8%至2.9%,相较于次优模型AADNet。此外,在六个评估设置中的四个里,这些提升在最小期望切换时长分布的比较中具有统计显著性。除了准确率之外,该模型在不同条件下表现出空间鲁棒性,因为EEG空间滤波器在各数据集上展现出稳定的模式。总体而言,本工作提出了一种准确且统一的AAD模型,在考虑在线处理场景实际优势的同时超越了现有方法。这些发现推动了AAD领域的发展及其在真实世界系统中的应用。

关键词

引用

@article{arxiv.2603.26394,
  title  = {CA-TCN: A Causal-Anticausal Temporal Convolutional Network for Direct Auditory Attention Decoding},
  author = {Iñigo García-Ugarte and Rubén Eguinoa and Ricardo San Martín and Daniel Paternain and Carmen Vidaurre},
  journal= {arXiv preprint arXiv:2603.26394},
  year   = {2026}
}