VicTR:用于活动识别的视频条件化文本表示
计算机视觉与模式识别
2024-04-01 v2
摘要
视觉-语言模型(VLMs)在图像领域表现出色——尤其在零样本设定下——这得益于海量预训练数据(即图像-文本配对样本)的可用性。然而对于视频,此类配对数据并不那么丰富。因此,视频-VLMs 通常通过将对预训练图像-VLMs 适配到视频领域来设计,而非从头训练。所有这些方案都依赖于用时间信息增强视觉嵌入(即图像 视频),通常保持文本嵌入不变甚至将其丢弃。在本文中,我们持相反观点,即通过更关注增强文本而非视觉信息,可以设计出更好的视频-VLMs。更具体地,我们引入了视频条件化文本表示(VicTR):一种相对于视觉嵌入进行优化的文本嵌入形式,创建了一个更灵活的对比潜在空间。我们的模型可以进一步利用免费可用的语义信息,以视觉接地的辅助文本形式(例如物体或场景信息)。我们在少样本、零样本(HMDB-51、UCF-101)、短形式(Kinetics-400)和长形式(Charades)活动识别基准上评估了我们的模型,在视频-VLMs 中展现出强劲性能。
引用
@article{arxiv.2304.02560,
title = {VicTR: Video-conditioned Text Representations for Activity Recognition},
author = {Kumara Kahatapitiya and Anurag Arnab and Arsha Nagrani and Michael S. Ryoo},
journal= {arXiv preprint arXiv:2304.02560},
year = {2024}
}
备注
To appear at CVPR 2024