VidFuncta:面向超声视频的通用神经表征
图像与视频处理
2025-07-30 v1 计算机视觉与模式识别
摘要
超声医学在临床护理中广泛应用,但标准深度学习方法在视频分析中常因获取非标准化及操作员偏差而难以胜任。我们提出一种新视角,将超声视频分析通过隐式神经表征(INR)来实现。我们基于 Functa 框架构建模型,其中每张图像由调制向量条件化的共享神经网络表示。然而,其向医学视频时域的扩展尚未探索。为此,我们提出 VidFuncta,一种新型框架,利用 Functa 对可变长度的超声视频编码为紧凑、时分辨率的表征。VidFuncta 将每个视频解耦为静态视频特有向量和一序列时序调制向量,既捕获时序动态,又捕获数据集层面的冗余。本方法在视频重建任务上超越 2D 和 3D 基线模型,并使下游任务可直接在所学习的 1D 调制向量上操作。我们在三个公开的超声视频数据集上对 VidFuncta 进行验证——心脏、肺部和乳腺——并评估其在心脏收缩量预测、B 线检测和乳腺肿瘤分类中的下游性能。这些结果凸显了 VidFuncta 作为面向超声视频的通用且高效表征框架的潜力。我们的代码已在 https://github.com/JuliaWolleb/VidFuncta_public 上公开。
引用
@article{arxiv.2507.21863,
title = {VidFuncta: Towards Generalizable Neural Representations for Ultrasound Videos},
author = {Julia Wolleb and Florentin Bieder and Paul Friedrich and Hemant D. Tagare and Xenophon Papademetris},
journal= {arXiv preprint arXiv:2507.21863},
year = {2025}
}
备注
Accepted 6th International Workshop of Advances in Simplifying Medical UltraSound (ASMUS) to be held at MICCAI 2025