从语义、场景到实例感知:为 grounded open-vocabulary situation recognition 蒸馊基础模型
计算机视觉与模式识别
2025-11-12 v3
摘要
近期的多模态大型语言模型(MLLM)表现出强大的零样学习能力,但在处理复杂的 grounded situation recognition(GSR)方面存在挑战,且对边缘设备部署资源消耗大。与此同时,传统的GSR模型常缺乏泛化能力,难以识别未见及罕见情形。本文通过将知识从教师MLLM传递给小型GSR模型,以提升其泛化和零样学习能力,提出了面向开放词汇的 grounded situation recognition(Ov-GSR)任务。为实现此目标,我们提出了多模态交互式提示蒸馊(MIPD)框架,从基础模型中蒸馊丰富的多模态知识,使学生Ov-GSR模型能够识别未见情形并更好地关注罕见情形。具体而言,MIPD框架首先利用基于LLM的判断性理由生成器(JRG)构建包含上下文语义信息的正负瞩视理由。随后引入场景感知和实例感知提示,通过负向引导的多模态提示对齐(NMPA)模块将理由与MLLM教师的视觉信息对齐,有效捕获整体和感知的多模态知识。最终将对齐后的多模态知识蒸馊到学生Ov-GSR模型中,为其泛化提供更坚实的基础,增强情境理解,缩小见情与未见情景之间的差距,缓解罕见案例预测偏差。我们在优化后的Ov-SWiG数据集上评估了MIPD,在见情、罕见及未见情形上均取得优异性能,并在HICO-DET数据集上进一步展示了更好的未见检测能力。
引用
@article{arxiv.2507.14686,
title = {From Semantics, Scene to Instance-awareness: Distilling Foundation Model for Grounded Open-vocabulary Situation Recognition},
author = {Chen Cai and Tianyi Liu and Jianjun Gao and Wenyang Liu and Kejun Wu and Ruoyu Wang and Yi Wang and Soo Chin Liew},
journal= {arXiv preprint arXiv:2507.14686},
year = {2025}
}