YOLO-RD:通过检索-字典引入相关且紧凑的显式知识
计算机视觉与模式识别
2025-02-11 v2 人工智能
摘要
在图像中识别和定位物体是基本难题,已有大量工作通过多样化的网络结构和优化训练策略来提升模型精度。然而,现有模型普遍过度关注当前输入,忽视整个数据集的信息。我们引入一种创新的检索-字典(Retriever-Dictionary, RD)模块以解决此问题。该架构使基于YOLO的模型能够高效检索包含数据集洞察的字典中的特征,而该字典由视觉模型(VM)、大语言模型(LLM)或视觉语言模型(VLM)的知识构建。灵活的RD模块使模型能够整合显式知识,从像素到图像级别增强分割、检测和分类等多个任务的能力。实验表明,使用RD显著提升了模型性能,在模型参数增加不到1%的情况下,目标检测的平均精度提升超过3%。除了单阶段目标检测模型,RD模块还提高了双阶段模型和DETR类架构(如Faster R-CNN和Deformable DETR)的效果。代码已发布于 https://github.com/henrytsui000/YOLO。
引用
@article{arxiv.2410.15346,
title = {YOLO-RD: Introducing Relevant and Compact Explicit Knowledge to YOLO by Retriever-Dictionary},
author = {Hao-Tang Tsui and Chien-Yao Wang and Hong-Yuan Mark Liao},
journal= {arXiv preprint arXiv:2410.15346},
year = {2025}
}