Few-Shot Image Classification and Segmentation as Visual Question Answering Using Vision-Language Models
网络与互联网体系结构
2024-03-28 v2
摘要
few-shot图像分类与分割(FS-CS)任务涉及仅凭少量目标类别示例,对查询图像中的目标对象进行分类与分割。我们提出Vision-Instructed Segmentation and Evaluation(VISE)方法,将FS-CS问题转化为视觉问答(VQA)问题,利用视觉语言模型(VLM)实现训练自由求解。通过使VLM能够将即插即用的视觉模型(如YOLO和Segment Anything Model)作为工具交互,所提方法仅凭图像级标签即可完成目标对象的分类与分割。具体而言,链式思维提示和情境学习引导VLM像人类一样回答多选问题;视觉模型协助VLM完成任务。该方法的模块化框架便于扩展。我们的方法在Pascal-5i和COCO-20i数据集上实现了最先进的性能。
关键词
引用
@article{arxiv.2403.10286,
title = {RACH-less Handover with Early Timing Advance Acquisition for Outage Reduction},
author = {Subhyal Bin Iqbal and Umur Karabulut and Ahmad Awada and Philipp Schulz and Gerhard P. Fettweis},
journal= {arXiv preprint arXiv:2403.10286},
year = {2024}
}
备注
7 pages, 7 figures. Accepted for presentation at the 2024 IEEE 99th Vehicular Technology Conference (VTC2024)-Spring to be held in Singapore