中文

超声声像基础视频翻译的生成式深度学习方法

计算机视觉与模式识别 2026-03-27 v2 人工智能

摘要

深度学习(DL)有望彻底变革医学影像的获取与解读,但需关注数据不平衡和缺失问题。超声声像因不同视图、结构及子模式(如灰度和彩色血流多普勒CFD)而具有挑战性,且在临床研究中常呈不平衡。图像翻译有助于平衡数据集,但目前针对超声子模式的翻译仍具挑战。本文提出一种生成方法,用于超声CFD-灰度视频翻译,训练于54,975个视频,测试于8,368个。该方法利用像素级、对抗式和感知损失,采用两个网络:一个用于重建解剖结构,另一个用于去噪,以实现逼真的超声成像。合成视频与真实视频之间的平均成对SSIM为0.91±0.04。合成视频在DL分类和分割任务中与真实视频无异,并通过盲目临床专家评估:F1分数分别为0.9和0.89;真实与合成分割的Dice系数达0.97。临床医生区分真实与合成视频的准确率为54±6%(42-61%),表明合成视频逼真。虽然仅在心脏视频上训练,模型在多个临床领域的超声视频均表现良好(平均SSIM为0.91±0.05),展现出基础性能力。这些数据扩展了 retrospectively 收集的影像实用性,丰富了医学影像数据集设计的工具箱。

关键词

引用

@article{arxiv.2511.03255,
  title  = {Generative deep learning for foundational video translation in ultrasound},
  author = {Nikolina Tomic and Roshni Bhatnagar and Sarthak Jain and Connor Lau and Tien-Yu Liu and Laura Gambini and Rima Arnaout},
  journal= {arXiv preprint arXiv:2511.03255},
  year   = {2026}
}