中文

HENASY: 学习组装场景实体以实现自我中心视频语言模型

计算机视觉与模式识别 2024-11-04 v4

摘要

当前视频语言模型(VLM)严重依赖视频和语言模态之间的实例级对齐,这带来了两个主要限制:(1)视觉推理违背了人类在第一人称视角下的自然感知,导致缺乏推理解释;(2)学习在捕捉两种模态之间固有的细粒度关系方面受到限制。在本文中,我们从人类感知中汲取灵感,探索了一种用于自我中心视频表示的组合方法。我们引入了HENASY(层次化实体组装),其中包括一个时空令牌分组机制,以显式地组装随时间动态演变的场景实体,并对其关系进行建模以进行视频表示。通过利用组合结构理解,HENASY通过自由形式文本查询的视觉基础具有强大的可解释性。我们进一步探索了一套多粒度对比损失,以促进以实体为中心的理解。这包括三种对齐类型:视频-叙述、名词-实体、动词-实体对齐。我们的方法在定量和定性实验中均表现出强大的可解释性;同时通过零样本迁移或作为视频/文本表示,在五个下游任务上保持竞争性能,包括视频/文本检索、动作识别、多选查询、自然语言查询和时刻查询。

关键词

引用

@article{arxiv.2406.00307,
  title  = {HENASY: Learning to Assemble Scene-Entities for Egocentric Video-Language Model},
  author = {Khoa Vo and Thinh Phan and Kashu Yamazaki and Minh Tran and Ngan Le},
  journal= {arXiv preprint arXiv:2406.00307},
  year   = {2024}
}

备注

Accepted to NeurIPS 2024