中文

UniRepLKNet:面向音频、视频、点云、时间序列与图像识别的通用感知大核卷积网络

计算机视觉与模式识别 2024-03-19 v2 人工智能 机器学习

摘要

大核卷积神经网络(ConvNets)近来受到广泛研究关注,但两个未解决的关键问题有待进一步探究。1) 现有大核ConvNets的架构在很大程度上遵循传统ConvNets或transformers的设计原则,而大核ConvNets的架构设计仍研究不足。2) 由于transformers已主导多种模态,ConvNets是否在视觉之外的领域也具有强大的通用感知能力仍有待研究。本文从两方面做出贡献。1) 我们提出设计大核ConvNets的四条架构准则,其核心是利用大核区别于小核的本质特征——它们无需加深即可看到宽广视野。遵循此类准则,我们所提大核ConvNet在图像识别中展现出领先性能(ImageNet准确率88.0%、ADE20K mIoU 55.6%、COCO box AP 56.4%),表现出优于近期强劲竞争对手的性能和更高速度。2) 我们发现大核是释放ConvNets在其原本不擅长领域中卓越性能的关键。借助特定的模态相关预处理方法,所提模型在时间序列预测与音频识别任务上达到了最先进性能,即便未对架构进行模态定制。所有代码与模型已在GitHub和Huggingface公开可用。

关键词

引用

@article{arxiv.2311.15599,
  title  = {UniRepLKNet: A Universal Perception Large-Kernel ConvNet for Audio, Video, Point Cloud, Time-Series and Image Recognition},
  author = {Xiaohan Ding and Yiyuan Zhang and Yixiao Ge and Sijie Zhao and Lin Song and Xiangyu Yue and Ying Shan},
  journal= {arXiv preprint arXiv:2311.15599},
  year   = {2024}
}

备注

CVPR 2024. Code, all the models, reproducible training scripts at https://github.com/AILab-CVC/UniRepLKNet