用于解码新生儿复苏中提供者注意力的视觉语言模型
计算机视觉与模式识别
2024-04-02 v1
摘要
新生儿复苏要求提供者具备极高的注意力水平,他们必须同时处理多个信息流。注视强烈影响决策;因此,了解提供者在新生儿复苏期间的注视位置可以为提供者培训提供信息,增强实时决策支持,并改进产房和新生儿重症监护病房的设计。当前量化新生儿提供者注视的方法依赖于手动编码或模拟,这限制了可扩展性和实用性。在这里,我们介绍一种自动化的实时深度学习方法,能够直接从现场复苏期间记录的第一人称视角视频中将提供者注视解码为语义类别。结合最先进的实时分割与视觉语言模型(CLIP),我们的低样本流程在无需训练的情况下实现了91%的注视目标分类准确率。经过微调后,我们的注视引导视觉变换器的注视分类准确率超过98%,接近人类水平。该系统能够进行实时推理,实现了对现场新生儿复苏期间提供者注意力动态的客观量化。我们的方法提供了一种可扩展的解决方案,能够无缝集成到现有基础设施中,用于数据稀缺的注视分析,从而为理解和优化临床决策提供了新的机会。
引用
@article{arxiv.2404.01207,
title = {Vision-language models for decoding provider attention during neonatal resuscitation},
author = {Felipe Parodi and Jordan Matelsky and Alejandra Regla-Vargas and Elizabeth Foglia and Charis Lim and Danielle Weinberg and Konrad Kording and Heidi Herrick and Michael Platt},
journal= {arXiv preprint arXiv:2404.01207},
year = {2024}
}
备注
9 pages, 4 figures