基于多层级类感知标记转换器的视觉查询式胎儿超声视频标准解剖片段局化方法 MCAT
计算机视觉与模式识别
2025-04-09 v1 人工智能
机器学习
摘要
准确获取胎儿超声 (US) 视频中的标准平面对于胎儿生长评估、异常检测以及遵循临床指南至关重要。然而,手动选择标准帧既耗时又容易受到 intra- 和 inter- 超声师之间变异性的影响。现有方法主要依赖基于图像的方法来捕获标准帧,然后对输入帧在不同解剖学上的分类,这忽略了视频获取及其解释的动态特性。为此,我们引入了多层级类感知标记转换器 (Multi-Tier Class-Aware Token Transformer, MCAT),这是一种基于视觉查询的视频片段局化 (VQ-VCL) 方法,旨在通过使超声师能够进行快速扫描来辅助他们。随后,MCAT 提供您希望分析的解剖学的视觉查询,MCAT 返回包含该解剖学标准帧的视频片段,从而促进对潜在异常的全面筛查。我们在两个超声视频数据集和一个基于 Ego4D 的自然图像 VQ-VCL 数据集上对 MCAT 进行评估。我们的模型在超声数据集和 Ego4D 数据集上分别以 10% 和 13% mIoU 超过最先进的方法,同时使用 96% 更少的标记。MCAT 的效率和准确性在公共卫生领域具有重大潜在意义,尤其是在中低收入国家 (LMICs),其中可能通过简化标准平面获取、简化基于 US 的筛查、诊断并允许超声师检查更多患者来提高产前护理水平。
引用
@article{arxiv.2504.06088,
title = {MCAT: Visual Query-Based Localization of Standard Anatomical Clips in Fetal Ultrasound Videos Using Multi-Tier Class-Aware Token Transformer},
author = {Divyanshu Mishra and Pramit Saha and He Zhao and Netzahualcoyotl Hernandez-Cruz and Olga Patey and Aris Papageorghiou and J. Alison Noble},
journal= {arXiv preprint arXiv:2504.06088},
year = {2025}
}
备注
Accepted in AAAI 2025