基于混合 Vision Transformer-U-Net 的细胞牵拉力场重建
计算机视觉与模式识别
2026-03-17 v1
摘要
牵拉力显微镜(TFM)是量化细胞对其周围细胞外基质施加力量的常用技术。尽管近期已将深度学习方法应用于 TFM 数据分析,但仍面临多个挑战——尤其是实现跨多个空间尺度的可靠推断,以及整合额外的上下文信息(如细胞类型)以提升准确性。本研究提出 ViT+UNet,一种集成 U-Net 与 Vision Transformer 的稳健深度学习架构。我们的实验结果表明,该混合模型在预测牵拉力场方面优于独立的 U-Net 和 Vision Transformer 架构。此外,ViT+UNet 在 diverse 空间尺度和 varying 噪声水平下的泛化能力显著优于单一架构,使其可应用于来自不同实验 setup 和 imaging 系统的 TFM 数据集。通过恰当地结构化输入数据,我们的方法也允许将元数据(本研究中为细胞类型信息)纳入,以提升预测的特定性和准确性。
引用
@article{arxiv.2603.13400,
title = {Combining Microscopy Data and Metadata for Reconstruction of Cellular Traction Forces Using a Hybrid Vision Transformer-U-Net},
author = {Yunfei Huang and Elena Van der Vorst and Alexander Richard and Benedikt Sabass},
journal= {arXiv preprint arXiv:2603.13400},
year = {2026}
}