中文

面向多任务心脏分析的语言-信号-视觉多模态框架

人工智能 2025-08-19 v1

摘要

当代心血管管理涉及复杂的考虑和整合多模态心脏数据集,其中每种模态提供独特且互补的生理特征。虽然有效整合多种模态可能 yield 一个准确地建模真实临床情况的整体临床概览,考虑到数据模态及其相对权重,但当前方法仍受限于:1) 患者和时间对齐的多模态数据的稀缺;2) 依赖孤立的单模态或僵化的多模态输入组合;3) 优先考虑跨模态相似性而非互补性的对齐策略;以及4) 狭窄的单一任务焦点。针对这些限制,我们策划了一个全面的多模态数据集,用于立即应用,将实验室检测结果、心电图和超声心动图与临床结局相结合。随后提出了一个统一框架,文本引导多模态融合用于多种心脏任务 (TGMM)。TGMM 包含三个关键组件:1) 一个 MedFlexFusion 模块,用于捕捉医学模态的独特且互补特征,并动态整合来自多种心脏来源及其组合的数据;2) 文本引导模块,用于为包括心脏病诊断、风险分层和信息检索等多样临床目标定制任务相关的表示;3) 响应模块,用于为所有这些任务产生最终决策。此外,本研究系统性地探讨了跨多个模态的关键特征,阐明了其在临床决策中的协同贡献。广泛的实验表明,TGMM 在多个临床任务上超越了最先进的方法,额外的验证确认了其在另一个公共数据集上的鲁棒性。

关键词

引用

@article{arxiv.2508.13072,
  title  = {A Language-Signal-Vision Multimodal Framework for Multitask Cardiac Analysis},
  author = {Yuting Zhang and Tiantian Geng and Luoying Hao and Xinxing Cheng and Alexander Thorley and Xiaoxia Wang and Wenqi Lu and Sandeep S Hothi and Lei Wei and Zhaowen Qiu and Dipak Kotecha and Jinming Duan},
  journal= {arXiv preprint arXiv:2508.13072},
  year   = {2025}
}