肺超声模型气胸相关体征的外部基准测试:基于清单的多来源研究
图像与视频处理
2026-03-31 v1 计算机视觉与模式识别
摘要
背景与目标:针对气胸相关肺超声(LUS)AI的可复现外部基准测试较为稀缺,而二分类肺滑动分类可能会掩盖临床重要的体征。因此,我们开发了一个基于清单的外部基准测试,并使用它来测试跨领域泛化性和任务有效性。方法:我们从190个公开可访问的LUS源视频中整理出280个片段,并发布了一个包含URL、时间戳、裁剪坐标、标签和探头形状的重建清单。标签包括正常肺滑动、无肺滑动、肺点和肺脉搏。一个先前发表的单站点二分类器在此基准测试上进行了评估;挑战状态分析使用无滑动预测概率P(absent)来检验肺点和肺脉搏。结果:单站点比较器在领域内达到了ROC-AUC 0.9625,但在异质性外部基准测试上仅为0.7050;将外部评估限制在线性片段上仍然得到ROC-AUC 0.7212。在挑战状态分析中,平均P(absent)排序为无滑动(0.504) > 肺点(0.313) > 正常(0.186) > 肺脉搏(0.143)。肺脉搏与无滑动片段不同(p=0.000470),但与正常片段无差异(p=0.813),表明二分类模型在无滑动的情况下将脉搏视为类似正常的信号。肺点与无滑动(p=0.000468)和正常(p=0.000026)均不同,支持其被解释为中间模糊状态而非清晰的二分类类别。结论:基于清单的多来源基准测试可以在不重新分发源视频的情况下支持可复现的外部评估。二分类肺滑动分类是气胸推理的不完整代理,因为它掩盖了肺脉搏和肺点等盲区和模糊状态。
引用
@article{arxiv.2603.26832,
title = {External Benchmarking of Lung Ultrasound Models for Pneumothorax-Related Signs: A Manifest-Based Multi-Source Study},
author = {Takehiro Ishikawa},
journal= {arXiv preprint arXiv:2603.26832},
year = {2026}
}