中文

DECAF:面向语音包络重建的动态包络上下文感知融合

声音 2026-02-24 v1 信号处理

摘要

从尺度神经记录(EEG)重建语音音频包络是解码听者注意力焦点的核心任务,广泛应用于神经导向听力助手等应用领域。然而,当前方法在保真度和噪声鲁棒性方面存在挑战。现有方法将其视为静态回归问题,孤立处理每个EEG窗口,忽略连续语音中固有的丰富时序结构。本研究提出一种新型动态框架,利用时序结构作为预测时序先验。我们提出一种状态空间融合模型,将来自EEG的直接神经估计与来自近期语音上下文的预测相结合,通过学习的门控机制自适应平衡这些线索。为验证该方法,我们在ICASSP 2023刺激重建基准测试中评估了模型,显著优于基于EEG的静态基线方法。我们的分析揭示了神经信息流与时序信息流之间的强大协同作用。最终,本工作重新定义了包络重建问题,将其从简单的映射问题,转化为动态状态估计问题,为开发更精确、连贯的神经解码系统开辟了新方向。

关键词

引用

@article{arxiv.2602.19395,
  title  = {DECAF: Dynamic Envelope Context-Aware Fusion for Speech-Envelope Reconstruction from EEG},
  author = {Karan Thakkar and Mounya Elhilali},
  journal= {arXiv preprint arXiv:2602.19395},
  year   = {2026}
}

备注

Accepted at ICASSP 2026