中文

VariViT:用于可变图像尺寸的视觉 Transformer

计算机视觉与模式识别 2026-02-17 v1 人工智能 机器学习

摘要

视觉 Transformer(ViT)已成为表征学习中的前沿架构,利用自注意力机制在各种任务中表现突出。ViT 将图像划分为固定大小的补丁,限制其为预定义尺寸,需进行调整、填充或裁剪等预处理步骤。这在医学成像中尤具挑战,尤其是对于形状不规则的结构如肿瘤。固定的边界框裁剪尺寸会产生前景-背景比例高度变化的输入图像。调整医学图像大小会损失信息并引入人工物,影响诊断。因此,针对感兴趣的区域定制可变尺寸裁剪可提升特征表征能力。此外,大图像计算成本高昂,小尺寸则风险信息丢失,呈现计算-精度权衡。我们提出 VariViT,一种改进的 ViT 模型,旨在处理可变图像尺寸同时保持一致的补丁尺寸。VariViT 采用新型位置嵌入调整方案,以适应可变补丁数量。我们还在 VariViT 中实现了新的批处理策略以降低计算复杂度,实现更快的训练和推理速度。在两个 3D 脑 MRI 数据集上的评估显示,VariViT 在脑肿瘤分类和脑肿瘤基因型预测中超越普通 ViT 和 ResNet,分别实现 75.5% 和 76.3% 的 F1 分数,学习到更具辨别力的特征。我们的批处理策略比传统架构缩短计算时间最长 30%。这些发现凸显了 VariViT 在图像表征学习中的有效性。我们的代码可在 https://github.com/Aswathi-Varma/varivit 查看。

关键词

引用

@article{arxiv.2602.14615,
  title  = {VariViT: A Vision Transformer for Variable Image Sizes},
  author = {Aswathi Varma and Suprosanna Shit and Chinmay Prabhakar and Daniel Scholz and Hongwei Bran Li and Bjoern Menze and Daniel Rueckert and Benedikt Wiestler},
  journal= {arXiv preprint arXiv:2602.14615},
  year   = {2026}
}