OW-VISCapTor:面向开放世界视频实例分割与描述的抽象器
计算机视觉与模式识别
2024-04-05 v1
摘要
我们提出了新的任务"开放世界视频实例分割与描述"。它要求检测、分割、跟踪并为从未见过的对象生成丰富的描述。这个具有挑战性的任务可以通过开发"抽象器"来实现,这些抽象器连接视觉模型和语言基础模型。具体而言,我们连接多尺度视觉特征提取器和大语言模型(LLM),通过开发对象抽象器和对象到文本抽象器来实现。对象抽象器由提示编码器和转换块组成,引入空间多样性的对象查询,以发现视频中从未见过的对象。额外的查询对比损失进一步鼓励对象查询的多样性。对象到文本抽象器通过掩码注意力增强,并充当对象查询与冻结LLM之间的桥梁,以为每个检测到的对象生成丰富且具有描述性的对象中心描述。我们的通用方法在从未见过的对象上超过了联合解决开放世界视频实例分割和密集视频对象描述任务的基线方法13%,在对象中心描述上超过10%。
引用
@article{arxiv.2404.03656,
title = {MVD-Fusion: Single-view 3D via Depth-consistent Multi-view Generation},
author = {Hanzhe Hu and Zhizhuo Zhou and Varun Jampani and Shubham Tulsiani},
journal= {arXiv preprint arXiv:2404.03656},
year = {2024}
}
备注
Project page: https://mvd-fusion.github.io/