面内约束的Transformer用于心脏彩超声图分析
计算机视觉与模式识别
2025-11-04 v1
摘要
视频Transformer最近在彩超声图(echo)分析中显示出强大的潜力,利用自监督预训练和灵活的跨任务适应。然而,像其他作用于视频的模型一样,它们容易学习来自非诊断区域(如图像背景)的伪相关。为克服这一限制,我们提出了视频面内约束Transformer(ViACT),这是一种新型框架,将解剖先验直接集成到Transformer架构中。ViACT将变形的解剖结构表示为点集,并编码其空间几何和对应的图像块到Transformer标记。预训练期间,ViACT遵循仅对解剖块进行掩码和重建的掩码自动编码策略,以强制表示学习聚焦于解剖区域。预训练好的模型随后可针对该区域内的任务进行微调。本文我们聚焦于心肌,展示了该框架在彩超声图分析任务上的应用,如左心室射血分数(EF)回归和心脏蛋白酶样变(CA)检测。解剖约束使Transformer注意力集中于心肌区域,生成与已知CA病理区域一致的可解释注意力图。此外,ViACT可用于心肌点追踪,不需要特定于任务的组件(如专用跟踪网络中使用的相关体积)。
引用
@article{arxiv.2511.01109,
title = {Anatomically Constrained Transformers for Echocardiogram Analysis},
author = {Alexander Thorley and Agis Chartsias and Jordan Strom and Jeremy Slivnick and Dipak Kotecha and Alberto Gomez and Jinming Duan},
journal= {arXiv preprint arXiv:2511.01109},
year = {2025}
}