中文

DIVINE:用于口面神经障碍评估的多模态解缠表示协调

音频与语音处理 2026-01-13 v1 声音

摘要

本研究提出了一种用于预测神经面部障碍的多模态框架,捕捉声带和面部线索。我们假设,在多模态基础模型嵌入中显式解缠共享和模态特定表示可增强临床可解释性和泛化能力。为验证这一假设,我们提出了 DIVINE 一个完全解缠的多模态框架, operates on 来自最先进 (SOTA) 音频和视频基础模型提取的表示,包含层次变分瓶颈、稀疏门控融合和可学习症状标记。DIVINE 在多任务学习设置中运行,联合预测诊断类别 (健康对照、ALS、中风) 和严重程度水平 (轻度、中度、严重)。该模型使用同步的音频和视频输入进行训练,并在Toronto NeuroFace 数据集上进行评估,测试条件包括完整 (音频-视频) 以及单模态 (音频-only 和视频-only)。我们提出的方法 DIVINE 实现了 SOTA 结果,DeepSeek-VL2 和 TRILLsson 组合达到 98.26% 的准确率和 97.51% 的 F1 分数。在受限模态的场景下,该框架表现良好,在仅使用视频或音频输入测试时展现出强大的泛化能力。它始终优于单模态模型和基线融合技术。鉴于 DIVINE 是首个将跨模态解缠、自适应融合和多任务学习相结合,用于同步语音和面部视频综合评估神经障碍的框架,我们深信其具有意义。

关键词

引用

@article{arxiv.2601.07014,
  title  = {DIVINE: Coordinating Multimodal Disentangled Representations for Oro-Facial Neurological Disorder Assessment},
  author = {Mohd Mujtaba Akhtar and Girish and Muskaan Singh},
  journal= {arXiv preprint arXiv:2601.07014},
  year   = {2026}
}

备注

Accepted to EACL 2026