利用基础模型解读COVID侧流检测结果
计算机视觉与模式识别
2024-04-24 v1 图像与视频处理
摘要
侧流检测(LFT)能够对包括新冠、怀孕、HIV和疟疾在内的健康状况进行快速、低成本的检测。自动读取LFT结果可以带来许多好处,包括使盲人能够独立了解自己的健康状况,以及通过仅使用每张LFT检测的一张照片来加速大规模监测(例如新冠等大流行病)的数据录入。因此,我们探索了现代基础视觉语言模型(VLM)在解读此类检测方面的能力。为了进行这项分析,我们首先创建了一个新的标注数据集,其中包含每个LFT检测及其嵌套检测结果窗口的分层分割。我们将该数据集命名为LFT-Grounding。接下来,我们在零样本设置下对八个现代VLM进行了基准测试,用于分析这些图像。我们证明,当前的VLM经常无法正确识别LFT检测的类型、解读检测结果、定位LFT检测的嵌套结果窗口,以及在LFT检测部分被遮挡时识别它们。为了促进社区在自动LFT读取方面的进展,我们在https://iamstuti.github.io/lft_grounding_foundation_models/公开发布了我们的数据集。
引用
@article{arxiv.2404.14990,
title = {Interpreting COVID Lateral Flow Tests' Results with Foundation Models},
author = {Stuti Pandey and Josh Myers-Dean and Jarek Reynolds and Danna Gurari},
journal= {arXiv preprint arXiv:2404.14990},
year = {2024}
}