MuViT:面向显微镜多尺度学习的多分辨率视觉转换器
计算机视觉与模式识别
2026-03-02 v1 机器学习
摘要
现代显微镜常常产生包含多个空间尺度结构的百万像素图像,从细胞形态到更广的组织结构不等。许多分析任务需要组合这些尺度,但大多数视觉模型要么在单一分辨率上运行,要么从单一视图派生多尺度特征,限制了其利用显微镜数据固有的多分辨率本质的能力。我们引入 MuViT,一个内置于单一编码器中融合真实多分辨率观察的转换器架构。MuViT 将所有 patch 嵌入共享的世界坐标系,并扩展旋转位置编码以这些坐标,使注意力能够在单个编码器中整合宽场背景与高分辨率细节。跨合成基准、肾脏组织病理学和高分辨率小鼠脑显微镜,MuViT 相对于强大的 ViT 和 CNN 基线持续提供改进。多分辨率 MAE 预训练进一步产生尺度一致的表示,增强下游任务。这些结果表明,显式的世界坐标建模为大规模显微镜分析中利用多分辨率信息提供了简单而强大的机制。
引用
@article{arxiv.2602.24222,
title = {MuViT: Multi-Resolution Vision Transformers for Learning Across Scales in Microscopy},
author = {Albert Dominguez Mantes and Gioele La Manno and Martin Weigert},
journal= {arXiv preprint arXiv:2602.24222},
year = {2026}
}
备注
Accepted at CVPR 2026