Avengers Assemble:用于抑郁症检测的非语义特征融合
音频与语音处理
2024-09-24 v1 声音
摘要
在本研究中,我们探讨了从语音中进行抑郁症检测的挑战,重点关注非语义特征 (NSFs) 捕捉抑郁症细微标志的潜力。虽然先前的研究利用了各种特征来完成这项任务,但从针对副语言语音处理 (TRILLsson)、说话人识别 (x-vector) 和情感识别 (emoHuBERT) 等非语义任务设计的预训练模型 (PTMs) 中提取的 NSFs 已展现出显著的前景。然而,组合这些多样化特征的潜力尚未得到充分探索。在这项工作中,我们证明了 NSFs 的融合会产生互补行为,从而提升抑郁症检测的性能。此外,我们引入了一个简单的新框架 FuSeR,旨在有效地组合这些特征。我们的结果表明,FuSeR 优于使用单个 NSFs 的模型以及基线融合技术,并在 E-DAIC 基准上取得了 5.51 的 RMSE 和 4.48 的 MAE,达到了最先进的 (SOTA) 性能,确立了其作为抑郁症检测稳健方法的地位。
引用
@article{arxiv.2409.14312,
title = {Avengers Assemble: Amalgamation of Non-Semantic Features for Depression Detection},
author = {Orchid Chetia Phukan and Swarup Ranjan Behera and Shubham Singh and Muskaan Singh and Vandana Rajan and Arun Balaji Buduru and Rajesh Sharma and S. R. Mahadeva Prasanna},
journal= {arXiv preprint arXiv:2409.14312},
year = {2024}
}
备注
Submitted to ICASSP 2025