多模态学习与放射科学认知过程:MedGaze 用于胸部X光扫描路径预测
图像与视频处理
2024-07-02 v1 人工智能
人机交互
摘要
预测计算机视觉中人类注视行为对于开发能够预测用户注意力的交互式系统至关重要,这不仅涉及认知科学中的基本问题,也对人机交互(HCI)和增强/虚拟现实(AR/VR)系统具有重要意义。尽管已提出多种方法来建模人类眼动行为,但将这些模型应用于医学影像进行扫描路径预测仍未探索。我们提出的系统旨在从放射科学报告和胸部X光(CXR)图像中预测眼动序列,从而可能 streamlining 数据收集并利用更大数据集增强AI系统。然而,对医学图像进行扫描路径预测存在独特挑战,由于异常区域的多样性。我们的模型预测扫描路径中至关重要的注视坐标和持续时间,在计算机视觉社区中超越了现有模型。通过采用两阶段训练过程和大型公开数据集,我们的方法生成静态热图和与放射科学报告一致的眼动视频,从而支持全面分析。我们通过与最先进方法的比较来验证我们的方法,并评估其在不同放射科学家之间的可通用性,引入了建模放射科学家在CXR图像诊断期间搜索模式的新策略。根据放射科学家的评估,MedGaze 能够生成在CXR图像上高度聚焦于相关区域的人类样态注视序列。有时它在扫描路径的冗余性和随机性方面甚至超越了人类。
引用
@article{arxiv.2407.00129,
title = {Multimodal Learning and Cognitive Processes in Radiology: MedGaze for Chest X-ray Scanpath Prediction},
author = {Akash Awasthi and Ngan Le and Zhigang Deng and Rishi Agrawal and Carol C. Wu and Hien Van Nguyen},
journal= {arXiv preprint arXiv:2407.00129},
year = {2024}
}
备注
Submitted to the Journal