去偏多模态心电图分析
计算与语言
2024-11-25 v1
摘要
多模态大语言模型(MLLMs)正在在医疗领域广泛应用,尤其是在医学影像中。然而,针对临床中至关重要的心电图(ECG)信号开发 MLLMs,仍面临着显著的挑战。先前的研究尝试通过训练无关的方式将 ECG 转换为多个文本标签来解决此问题,但这种方法显著压缩了 ECG 中的信息,未能充分利用大语言模型的推理能力。本文通过投影层将 ECG 的嵌入向量直接输入到大语言模型中,保留了更多关于 ECG 的信息,并更好地利用了大语言模型的推理能力。我们的方法还能有效处理临床实践中常见的情形,即需要比较两个不同时间拍摄的 ECG。最近的研究发现,MLLMs 可能仅依赖文本输入来提供答案,忽略了来自其他模态的输入。我们从因果论的角度在 ECG MLLM 语境中分析了这一现象,并发现疾病严重程度这一混杂变量引入了问题与答案之间的虚假关联,导致模型依赖于这种虚假关联而忽略 ECG 输入。此类模型并未理解 ECG 输入,在对抗测试中表现不佳,其中训练集和测试集使用不同的问题表达方式。我们设计了一种去偏预训练方法,依据背门调整理论消除混杂变量的影响。我们的模型在 ECG-QA 任务下进行对抗测试时表现良好,并展现出零样本能力。进一步的随机 ECG 测试进一步验证了我们的模型有效地理解和利用了输入的 ECG 信号。
引用
@article{arxiv.2411.14795,
title = {De-biased Multimodal Electrocardiogram Analysis},
author = {Haitao Li and Ziyu Li and Yiheng Mao and Ziyi Liu and Zhoujian Sun and Zhengxing Huang},
journal= {arXiv preprint arXiv:2411.14795},
year = {2024}
}