中文

探索键值注意力在纯 Transformer 与混合 Transformer 语义分割中的集成

计算机视觉与模式识别 2025-03-25 v1 人工智能 机器学习

摘要

虽然 CNN 长期以来被视为图像处理领域的最佳方法,但 Transformer 架构的引入对这一地位构成了挑战。尽管在图像分类和分割方面取得了优异的结果,Transformer 仍然本质上依赖于大规模训练数据集,并且计算成本高昂。一种新引入的 Transformer 衍生模型——KV Transformer,在合成任务、自然语言处理和图像分类任务中展现出有前景的结果,同时降低了复杂度和内存使用。这特别有利于需要本地推理的应用场景,例如医学筛查应用。我们致力于进一步评估 KV Transformer 在语义分割任务(特别是医学成像领域)中的价值。通过直接比较相同基础架构的传统变体和 KV 变体,我们提供了关于降低模型复杂度所带来的实际权衡的进一步见解。我们观察到参数数量和乘累加运算显著减少,同时大多数 KV 变体模型在与对应的 QKV 实现直接比较时实现了相当的性能。

关键词

引用

@article{arxiv.2503.18862,
  title  = {Exploring the Integration of Key-Value Attention Into Pure and Hybrid Transformers for Semantic Segmentation},
  author = {DeShin Hwa and Tobias Holmes and Klaus Drechsler},
  journal= {arXiv preprint arXiv:2503.18862},
  year   = {2025}
}

备注

6 pages, 3 figures, Preprint. Final version published in: Bildverarbeitung f\"ur die Medizin 2025, Springer. DOI: https://doi.org/10.1007/978-3-658-47422-5_71