中文

基于富文本的跨域多模态少样本目标检测

计算机视觉与模式识别 2025-02-25 v2

摘要

由于能够生成更丰富的特征,跨模态特征提取与集成在少样本学习任务中带来了稳定的性能提升。然而,现有的多模态目标检测(MM-OD)方法在面对显著的域偏移和样本不足时性能会下降。我们假设富文本信息能更有效地帮助模型构建视觉实例与其语言描述之间的知识关系,并有助于缓解域偏移。具体而言,我们研究了 MM-OD 的跨域少样本泛化(CDMM-FSOD),并提出了一种基于元学习的多模态少样本目标检测方法,该方法利用富文本语义信息作为辅助模态,以在 FSOD 背景下实现域自适应。我们提出的网络包含:一个多模态特征聚合模块,用于对齐视觉和语言支持特征嵌入;以及一个富文本语义校正模块,该模块利用双向文本特征生成来增强多模态特征对齐,从而增强模型的语言理解能力。我们在常见的标准跨域目标检测数据集上评估了我们的模型,并证明我们的方法显著优于现有的 FSOD 方法。

关键词

引用

@article{arxiv.2403.16188,
  title  = {Cross-domain Multi-modal Few-shot Object Detection via Rich Text},
  author = {Zeyu Shangguan and Daniel Seita and Mohammad Rostami},
  journal= {arXiv preprint arXiv:2403.16188},
  year   = {2025}
}