面向抑郁诊断的鲁棒脑类声学特征提取器 RBA-FE
声音
2025-06-10 v1 人工智能
音频与语音处理
摘要
本文提出一种用于抑郁诊断的鲁棒脑类声学特征提取器 (RBA-FE) 模型,采用改进的层次化网络架构。大多数深度学习模型在基于图像的诊断任务中实现了最先进的性能,却忽视了声学特征的对应对象。在针对噪声挑战方面,RBA-FE 利用从原始音频中提取的六种声学特征,既捕获空间特征又捕获时序依赖性。这种混合属性有助于缓解其他学习模型(如深度残差压缩网络)在音频特征提取中的精度局限。为处理噪声问题,本模型融入了改进的脉冲神经元模型,称为自适应速率光滑积分发放神经元 (ARSLIF)。ARSLIF 模型模拟了大脑注意系统中“细胞信号选择性复位”机制,增强了模型对音频数据中环境噪声的鲁棒性。实验结果表明,RBA-FE 在 MODMA 数据集上实现了在精确率、准确率、召回率和 F1 分数方面的最先进性能,分别为 0.8750、0.8974、0.8750 和 0.8750。在 AVEC2014 和 DAIC-WOZ 数据集上进行的大量实验均显示出噪声鲁棒性的提升。与比较分析表明,ARSLIF 神经元模型表明在提取抑郁音频数据的特征时存在异常放电模式,提供了脑类可解释性。
引用
@article{arxiv.2506.07118,
title = {RBA-FE: A Robust Brain-Inspired Audio Feature Extractor for Depression Diagnosis},
author = {Yu-Xuan Wu and Ziyan Huang and Bin Hu and Zhi-Hong Guan},
journal= {arXiv preprint arXiv:2506.07118},
year = {2025}
}
备注
14 pages