MultiSense-Pneumo:面向资源受限环境的肺炎筛查多模态学习框架
计算机视觉与模式识别
2026-05-27 v2 人工智能
机器学习
摘要
肺炎仍是全球致死病因中居前列的疾病,尤其在资源有限的地区,由于获取影像学检查、实验室检测和专科医护人员的途径受限。临床评估依赖于多样化的证据,包括症状、呼吸模式、语音描述和胸部影像,使得前线筛查本质上具有多模态特征。然而,许多现有计算方法仍是单模态的,主要关注胸片。本文提出 MultiSense-Pneumo,一个用于肺炎导向筛查和分流支持的多模态研究原型,集成了结构化症状描述、咳嗽音频、语音语言和胸部X光成像。该系统组合了确定性症状分流、LightGBM 基于声学的分类、使用 ResNet-18 的领域对抗性胸片分析、基于变换器的语音识别,以及可解释的晚期融合算子。每个模态被转换为标准化的担忧信号,并聚合为统一的筛查估计。融合权重是手工指定的,作为启发式、可解释的参数,而非学习或临床优化的值。MultiSense-Pneumo 在标准笔记本级硬件上实现离线执行,但本文并不将其作为已验证或临床验证的诊断系统。实验结果显示,胸片路径在合成域迁移下的组件级性能良好,同时也突显了重要局限性,尤其是咳嗽声学的异常类别召回率降低以及缺乏端到端的多模态患者评估。因此,MultiSense-Pneumo 旨作为筛查和分流研究的框架和组件级原型。
引用
@article{arxiv.2605.02207,
title = {MultiSense-Pneumo: A Multimodal Learning Framework for Pneumonia Screening in Resource-Constrained Settings},
author = {Dineth Jayakody and Pasindu Thenahandi and Chameli Dommanige},
journal= {arXiv preprint arXiv:2605.02207},
year = {2026}
}