中文

语义引导的自然语言与视觉融合:基于微型目标检测的跨模态交互

计算机视觉与模式识别 2025-11-10 v1

摘要

本文提出一种前沿方法,针对微型目标检测的跨模态交互,结合语义引导的自然语言处理与先进的视觉识别主干网络。该方法将BERT语言模型与基于CNN的平行残差双融合特征金字塔网络(PRB-FPN-Net)集成,包含创新的主干网络架构如ELAN、MSP和CSP,以优化特征提取与融合。通过采用词形还原和微调技术,系统将文本输入中的语义线索与视觉特征对齐,提升对小尺度复杂目标的检测精度。使用COCO和Objects365数据集进行实验验证,结果表明该模型在检测性能上取得优异表现。在COCO2017验证集上,模型实现了52.6%的平均精度(AP),显著优于YOLO-World,同时仅为基于Transformer模型如GLIP的参数数的一半。不同主干网络(ELAN、MSP、CSP)的多项测试进一步表明该方法能够高效处理多尺度目标,确保在资源受限环境下的可扩展性和鲁棒性。本研究强调了将自然语言理解与先进主干架构集成的潜力,为目标检测精度、效率和适应实际挑战的能力树立了新基准。

关键词

引用

@article{arxiv.2511.05474,
  title  = {Semantic-Guided Natural Language and Visual Fusion for Cross-Modal Interaction Based on Tiny Object Detection},
  author = {Xian-Hong Huang and Hui-Kai Su and Chi-Chia Sun and Jun-Wei Hsieh},
  journal= {arXiv preprint arXiv:2511.05474},
  year   = {2025}
}