Context Length 与高效 Transformer 在生物医学图像分析中的影响研究
计算机视觉与模式识别
2025-01-03 v1 人工智能
机器学习
摘要
生物医学成像模态往往产生高分辨率、多维图像,给深度神经网络带来计算挑战。由于自注意力算子随上下文长度呈二次方增长,这些挑战在训练 Transformer 模型时尤为突出。近期的长上下文模型有望缓解这些困难,使 Transformer 更高效地应用于大型生物医学图像,但目前缺乏系统的评估。本研究探讨了上下文长度对生物医学图像分析的影响,并评估了最新长上下文模型的性能。我们首先构建了生物医学成像数据集,包括用于分割、去噪和分类任务的 2D 和 3D 数据。随后通过变更 patch 大小和注意力窗口大小,对 Vision Transformer 和 Swin Transformer 的网络性能进行上下文长度影响分析。我们的发现表明,上下文长度与网络性能之间存在密切关系,尤其在像素级预测任务中效果显著。最后,我们展示,最新的长上下文模型在保持可比性能的同时显著提升了效率,但也指出了其中的不足之处。这项工作凸显了长上下文模型在生物医学成像中的潜力与挑战。
引用
@article{arxiv.2501.00619,
title = {A Study on Context Length and Efficient Transformers for Biomedical Image Analysis},
author = {Sarah M. Hooper and Hui Xue},
journal= {arXiv preprint arXiv:2501.00619},
year = {2025}
}
备注
Published at ML4H 2024