面向伪装场景的综合多模态数据集MM-CamObj
计算机视觉与模式识别
2024-09-25 v1
摘要
大型视觉语言模型(LVMI)在多个应用中取得了巨大成功。然而,它们在复杂场景中仍面临挑战,尤其是涉及伪装对象的场景。这主要是由于训练数据集中缺乏与伪装场景相关的样本所致。为缓解这一问题,我们首次构建了MM-CamObj数据集,包含两个子集:CamObj-Align和CamObj-Instruct。具体而言,CamObj-Align包含11,363个图像-文本对,旨在用于VL对齐和将伪装场景的丰富知识注入LVMI。CamObj-Instruct是为改进LVMI的指令遵循能力而收集的,包括11,363张图片和68,849个包含多样指令的对话。基于MM-CamObj数据集,我们提出了CamObj-Llava,一种专为解决伪装场景任务而设计的LVMI。为促进模型有效获取关于伪装对象和场景的知识,我们引入了包含六种不同模式的课程学习策略。此外,我们构建了CamObj-Bench来评估现有LVMI在理解、识别、定位和计数伪装场景方面的能力。该基准包括600张图片和7个任务,总共9,449个问题。对CamObj-Bench上的CamObj-Llava以及8个开源和3个闭源LVMI进行了大量实验。令人惊讶的是,结果表明,我们的模型在4个任务中比GPT-4o提高了25.84%。代码和数据集将在https://github.com/JCruan519/MM-CamObj上提供。
引用
@article{arxiv.2409.16084,
title = {MM-CamObj: A Comprehensive Multimodal Dataset for Camouflaged Object Scenarios},
author = {Jiacheng Ruan and Wenzhen Yuan and Zehao Lin and Ning Liao and Zhiyu Li and Feiyu Xiong and Ting Liu and Yuzhuo Fu},
journal= {arXiv preprint arXiv:2409.16084},
year = {2024}
}
备注
9 pages, 5 figures. Work in progress