EchoCoTr:基于时空超声心动图的左室射血分数估计
计算机视觉与模式识别
2022-09-12 v1
摘要
学习时空特征是高效视频理解的重要任务,尤其在超声心动图等医学图像中。卷积神经网络(CNNs)和近年的视觉 transformer(ViTs)是最常用的方法,但各自存在局限。CNNs 善于捕捉局部上下文,却难以学习跨视频帧的全局信息。另一方面,视觉 transformer 可纳入全局细节与长序列,但计算开销大,且通常需要更多训练数据。本文中,我们提出了一种方法,以解决在医学视频数据(如超声心动图扫描)上训练时通常面临的限制。我们提出的算法(EchoCoTr)利用视觉 transformer 与 CNNs 的优势,处理超声视频上左室射血分数(LVEF)估计问题。我们展示了所提方法在 EchoNet-Dynamic 数据集上以 MAE 3.95 和 R^2 0.82 优于迄今最先进的工作。这些结果相较所有已发表研究均有显著提升。此外,我们给出了与若干算法(包括 ViT 和 BERT)的广泛消融实验与对比。代码见 https://github.com/BioMedIA-MBZUAI/EchoCoTr。
引用
@article{arxiv.2209.04242,
title = {EchoCoTr: Estimation of the Left Ventricular Ejection Fraction from Spatiotemporal Echocardiography},
author = {Rand Muhtaseb and Mohammad Yaqub},
journal= {arXiv preprint arXiv:2209.04242},
year = {2022}
}