基于动态融合的语音健康检测多模态网络
声音
2025-09-03 v2 人工智能
摘要
自杀是青少年死亡的首要原因之一。以往的自杀风险预测研究主要单独关注文本或语音信息,语音和文本等多模态信号的融合可更全面地理解个体的心理状态。针对 1 届 SpeechWellness 检测挑战赛,本文探索一种基于动态融合机制的轻量化多分支多模态系统用于语音健康检测。为解决以往方法依赖时域波形进行语音分析的局限,本系统包含时域特征、时频(TF)域语音特征以及语义表示。此外,我们引入动态融合模块以自适应方式整合不同模态的信息。具体做法是对每个模态施加可学习权重,以调整各模态的贡献。为提升计算效率,我们通过简化原始基线模型设计了轻量化结构。实验结果表明,所提出的系统相较于基线模型表现更佳,模型参数减少 78%,准确率提升 5%。
引用
@article{arxiv.2508.18057,
title = {Dynamic Fusion Multimodal Network for SpeechWellness Detection},
author = {Wenqiang Sun and Han Yin and Jisheng Bai and Jianfeng Chen},
journal= {arXiv preprint arXiv:2508.18057},
year = {2025}
}
备注
6 pages, 5figures