中文

一种多模态医学图像交互框架

人机交互 2024-07-10 v1 多媒体 声音 音频与语音处理

摘要

医生依赖人体解剖学图像(如MRI)来定位患者在诊断和治疗期间的感兴趣区域。尽管医学成像技术取得了进展,但信息传递仍是单模态的。这种视觉表示未能捕捉与人体组织进行真实多感官交互的复杂性。然而,在医疗程序和患者结果中,实时感知关于患者解剖结构和疾病的多模态信息至关重要。我们引入了多模态医学图像交互(MMII)框架,允许医疗专家在三维空间中与人体组织进行动态、听觉可视化交互。在虚拟现实环境中,用户接收基于物理的听觉可视化反馈,以提高解剖结构的空间感知。MMII使用基于模型的声学方法生成声音,源自组织的几何和物理属性,从而消除对手工声音设计的需求。我们进行了两项用户研究,涉及34名普通医生和9名临床专家,以评估所提出的交互框架的可学习性、可用性和准确性。我们的结果显示,听觉可视化对应关系的可学习性非常好,正确关联率在研究过程中显著改善(p < 0.001)。MMII在常规医学图像交互中的大脑肿瘤定位精度更优(p < 0.05)。我们的发现 substantiate 了这一新框架潜力的可能性,例如,在需要即时和精确反馈的手术程序中增强与医学图像的交互。

关键词

引用

@article{arxiv.2407.07015,
  title  = {A Framework for Multimodal Medical Image Interaction},
  author = {Laura Schütz and Sasan Matinfar and Gideon Schafroth and Navid Navab and Merle Fairhurst and Arthur Wagner and Benedikt Wiestler and Ulrich Eck and Nassir Navab},
  journal= {arXiv preprint arXiv:2407.07015},
  year   = {2024}
}

备注

Accepted for publication in IEEE TVCG; presentation at IEEE ISMAR 2024