Hyneter:用于目标检测的混合网络Transformer
计算机视觉与模式识别
2023-02-21 v1 人工智能
摘要
本文指出,基于CNN和基于Transformer的检测器之间的本质差异在于特征提取和传播中局部信息与全局依赖之间的鸿沟,这导致了基于Transformer的方法在小目标上性能较差。为了解决这些差异,我们在预实验表明该鸿沟导致基于CNN和基于Transformer的方法对不同尺寸目标的结果提升不均衡之后,提出了一种新的视觉Transformer,称为混合网络Transformer(Hyneter)。与先前方法中的分而治之策略不同,Hyneter由混合网络骨干(HNB)和双路切换模块(DS)组成,它们整合局部信息和全局依赖,并同时传递它们。基于平衡策略,HNB通过将卷积层嵌入到Transformer块中来扩展局部信息的范围,而DS则调整了块外对全局依赖的过度依赖。
引用
@article{arxiv.2302.09365,
title = {Hyneter: Hybrid Network Transformer for Object Detection},
author = {Dong Chen and Duoqian Miao and Xuerong Zhao},
journal= {arXiv preprint arXiv:2302.09365},
year = {2023}
}
备注
ICASSP 2023