通过在线聚类蒸馏学习超声心动图视频表示的自监督方法
计算机视觉与模式识别
2026-01-26 v3 人工智能
计算机与社会
机器学习
摘要
自监督学习(SSL)在自然图像和视频理解方面取得了重大进展,但在超声心动图(心脏超声)等领域仍面临挑战,原因包括细微的解剖结构、复杂的时序动力学以及目前缺乏领域特定的预训练模型。现有的SSL方法,如对比学习、掩码建模和基于聚类的方法,在处理高样本间相似性、对超声中常见的低PSNR输入的敏感性,或会扭曲临床相关特征的激进增强方面存在困难。我们提出了DISCOVR(跨模态视频表示的蒸馏图像监督),一种用于心脏超声视频表示学习的自监督双分支框架。DISCOVR结合了建模时序动力学的基于聚类的视频编码器和提取细粒度空间语义的在线图像编码器。这两个分支通过语义聚类蒸馏损失连接,将图像编码器中不断演化的解剖学知识传递给视频编码器,从而实现富含细粒度语义理解的时序连贯表示。在涵盖胎儿、儿童和成人六个超声心动图数据集上的评估表明,DISCOVR在零样本和线性探测设置中均优于专门视频异常检测方法和最先进的视频SSL基线,在分割迁移和LVEF预测等临床相关任务上取得了优异的下游性能。代码可在 https://github.com/mdivyanshu97/DISCOVR 获取。
引用
@article{arxiv.2506.11777,
title = {Self-supervised Learning of Echocardiographic Video Representations via Online Cluster Distillation},
author = {Divyanshu Mishra and Mohammadreza Salehi and Pramit Saha and Olga Patey and Aris T. Papageorghiou and Yuki M. Asano and J. Alison Noble},
journal= {arXiv preprint arXiv:2506.11777},
year = {2026}
}
备注
Accepted in NeurIPS 2025