中文

协同智能:结合大语言模型与小模型进行生理信号视觉检查

人工智能 2025-07-22 v2 机器学习 信号处理

摘要

大型语言模型(LLM)在视觉解释医学时间序列数据方面展现出了有前景的能力。然而,其通用设计可能限制领域特定的精度,且许多模型的专有性质对在专业临床数据集上进行微调提出了挑战。相反,小型专用模型(SSM)在聚焦任务上表现出色,但缺乏复杂医疗决策所需的更广泛推理能力。为了解决这些互补的局限性,我们引入了ConMIL(共形化多实例学习),一种新颖的决策支持框架,独特地协同了三个关键组件:(1)一种新的多实例学习(MIL)机制QTrans-Pooling,专为每类可解释性而设计,用于识别临床相关的生理信号片段;(2)共形预测,与MIL集成以生成具有统计可靠性保证的校准集值输出;(3)一种结构化方法,使这些可解释且量化不确定性的SSM输出能够增强LLM的视觉检查能力。我们在心律失常检测和睡眠阶段分类上的实验表明,ConMIL能够提高ChatGPT4.0、Qwen2-VL-7B和MiMo-VL-7B-RL等LLM的准确性。例如,在两项任务中,ConMIL支持的Qwen2-VL-7B和MiMo-VL-7B-RL在置信样本上分别达到94.92%和96.82%的精确率,在不确定样本上分别达到(70.61%和78.02%)/(78.10%和71.98%),而单独使用LLM时仅为46.13%和13.16%。这些结果表明,将任务特定模型与LLM集成可能为更可解释和可信赖的AI驱动临床决策支持提供一条有前景的途径。

关键词

引用

@article{arxiv.2501.16215,
  title  = {Smarter Together: Combining Large Language Models and Small Models for Physiological Signals Visual Inspection},
  author = {Huayu Li and Zhengxiao He and Xiwen Chen and Ci Zhang and Stuart F. Quan and William D. S. Killgore and Shu-Fen Wung and Chen X. Chen and Geng Yuan and Jin Lu and Ao Li},
  journal= {arXiv preprint arXiv:2501.16215},
  year   = {2025}
}