中文

MINT:一种使多模态和多图像AI模型具备交互性的封装方法

人机交互 2024-01-23 v1 人工智能

摘要

在诊断过程中,医生会整合包括影像和病史在内的多模态信息——同样,医学AI的发展也日益多模态化。本文我们解决一个更微妙的挑战:医生会采集有针对性的病史,只获取最相关的信息;我们如何让AI也能做到这一点?我们开发了一种名为MINT(使你的模型具备交互性)的封装方法,它能自动确定每一步哪些信息最有价值,并只询问最有用的信息。我们展示了MINT封装一个皮肤病预测模型的效果,该模型使用多张图像和一组针对25个标准元数据问题(即结构化病史)的可选答案,通过多模态深度网络提供鉴别诊断。我们表明,MINT能够识别是否需要元数据输入,如果需要,接下来该问哪个问题。我们还证明,在采集多张图像时,MINT可以识别额外图像是否有益,如果有益,该采集哪种类型的图像。我们展示了MINT将所需的元数据和图像输入数量分别减少了82%和36.2%,同时保持了预测性能。利用真实的AI皮肤病学系统数据,我们表明,减少所需输入可以留住那些可能无法完成系统提交、未获诊断就流失的用户。定性示例显示,MINT可以紧密模拟临床工作流程的逐步决策过程,以及这种过程在简单病例与更困难、模糊病例中的差异。最后,我们展示了MINT如何对不同的底层多模态分类器具有鲁棒性,并且无需显著的模型重新训练即可轻松适应用户需求。

关键词

引用

@article{arxiv.2401.12032,
  title  = {MINT: A wrapper to make multi-modal and multi-image AI models interactive},
  author = {Jan Freyberg and Abhijit Guha Roy and Terry Spitz and Beverly Freeman and Mike Schaekermann and Patricia Strachan and Eva Schnider and Renee Wong and Dale R Webster and Alan Karthikesalingam and Yun Liu and Krishnamurthy Dvijotham and Umesh Telang},
  journal= {arXiv preprint arXiv:2401.12032},
  year   = {2024}
}

备注

15 pages, 7 figures