中文

InstAP:面向时空理解的实例感知视觉语言预训练

计算机视觉与模式识别 2026-04-10 v1 人工智能

摘要

当前视觉语言预训练(VLP)范式在全局场景理解方面表现出色,但在实例级推理方面因仅依赖全局监督而受限。我们提出 InstAP(Instance-Aware Pre-training),一个实例感知预训练框架,通过将文本提及 grounding 到特定空间-时间区域,联合优化全局视觉-文本对齐和细粒度、实例级对比对齐。为支持这一目标,我们构建了 InstVL 数据集,包含 200 万张图片和 5 万段视频,提供双层粒度注释:整体场景描述和稠密的、以实例为单位的描述。 在 InstVL 数据集上,InstAP 在实例级检索方面显著优于现有 VLP 模型,也超越了在完全相同数据语料上训练的强大 VLP 基线,唯一隔离了我们实例感知目标的独立效应。此外,基于实例的预训练有助于提升全局理解能力:InstAP 在包括 MSR-VTT 和 DiDeMo 在内的多个视频基准测试上实现了具竞争力的零样态性能。定性可视化进一步表明,InstAP 将文本提及局部到正确的实例,而全局-only 模型则表现出更为分散的场景级注意力。

关键词

引用

@article{arxiv.2604.08337,
  title  = {InstAP: Instance-Aware Vision-Language Pre-Train for Spatial-Temporal Understanding},
  author = {Ashutosh Kumar and Rajat Saini and Jingjing Pan and Mustafa Erdogan and Mingfang Zhang and Betty Le Dem and Norimasa Kobori and Quan Kong},
  journal= {arXiv preprint arXiv:2604.08337},
  year   = {2026}
}