DECAF:面向语音包络重建的动态包络上下文感知融合
声音
2026-02-24 v1 信号处理
摘要
从尺度神经记录(EEG)重建语音音频包络是解码听者注意力焦点的核心任务,广泛应用于神经导向听力助手等应用领域。然而,当前方法在保真度和噪声鲁棒性方面存在挑战。现有方法将其视为静态回归问题,孤立处理每个EEG窗口,忽略连续语音中固有的丰富时序结构。本研究提出一种新型动态框架,利用时序结构作为预测时序先验。我们提出一种状态空间融合模型,将来自EEG的直接神经估计与来自近期语音上下文的预测相结合,通过学习的门控机制自适应平衡这些线索。为验证该方法,我们在ICASSP 2023刺激重建基准测试中评估了模型,显著优于基于EEG的静态基线方法。我们的分析揭示了神经信息流与时序信息流之间的强大协同作用。最终,本工作重新定义了包络重建问题,将其从简单的映射问题,转化为动态状态估计问题,为开发更精确、连贯的神经解码系统开辟了新方向。
引用
@article{arxiv.2602.19395,
title = {DECAF: Dynamic Envelope Context-Aware Fusion for Speech-Envelope Reconstruction from EEG},
author = {Karan Thakkar and Mounya Elhilali},
journal= {arXiv preprint arXiv:2602.19395},
year = {2026}
}
备注
Accepted at ICASSP 2026