中文

YotoR——你只需变换一种表示

计算机视觉与模式识别 2024-05-31 v1

摘要

本文介绍了YotoR(You Only Transform One Representation),一种结合了Swin Transformer和YoloR架构的新型深度学习目标检测模型。Transformer作为自然语言处理中的革命性技术,也对计算机视觉产生了重大影响,提供了提升准确性和计算效率的潜力。YotoR将强大的Swin Transformer骨干网络与YoloR的颈部和头部相结合。在我们的实验中,YotoR模型TP5和BP4在各种评估中始终优于YoloR P6和Swin Transformer,提供了比Swin Transformer模型更好的目标检测性能和更快的推理速度。这些结果凸显了进一步模型组合以及利用Transformer进行实时目标检测改进的潜力。论文最后强调了YotoR的更广泛影响,包括其增强基于Transformer的模型以处理图像相关任务的潜力。

关键词

引用

@article{arxiv.2405.19629,
  title  = {YotoR-You Only Transform One Representation},
  author = {José Ignacio Díaz Villa and Patricio Loncomilla and Javier Ruiz-del-Solar},
  journal= {arXiv preprint arXiv:2405.19629},
  year   = {2024}
}

备注

16 pages, 5 figures