中文

基于多模态语音特征的自杀风险评估:基于SW1挑战数据集的研究

计算与语言 2025-05-27 v1 机器学习 声音 音频与语音处理

摘要

第一次SpeechWellness挑战传递了基于语音的青少年自杀风险评估的需求。本研究探讨了针对该挑战的多模态方法,集成了来自WhisperX的自动转录、来自中文RoBERTa的语言嵌入以及来自WavLM的音频嵌入。此外,还Incorporated了手工制作的声学特征,包括MFCCs、谱对比度和音高相关统计信息。我们探索了三种融合策略:早期拼接、模态特定处理和带有mixup正则化的加权注意力。结果表明,加权注意力提供了最佳的概括能力,在开发集上达到了69%的准确率,尽管开发集和测试集之间的性能差距突显了概括挑战。我们的发现严格基于MINI-KID框架,强调了细化嵌入表示和融合机制以增强分类可靠性的重要性。

关键词

引用

@article{arxiv.2505.13069,
  title  = {Suicide Risk Assessment Using Multimodal Speech Features: A Study on the SW1 Challenge Dataset},
  author = {Ambre Marie and Ilias Maoudj and Guillaume Dardenne and Gwenolé Quellec},
  journal= {arXiv preprint arXiv:2505.13069},
  year   = {2025}
}

备注

Submitted to the SpeechWellness Challenge at Interspeech 2025; 5 pages, 2 figures, 2 tables