面向长期动作预测的物体中心视频表示
计算机视觉与模式识别
2023-11-02 v1
摘要
本文关注于为视频中的长期动作预测构建物体中心表示。我们的核心动机是,物体提供了识别和预测人-物交互的重要线索,尤其在预测时间更长时,因为一个被观察到的“背景”物体可能在未来被人类行为者使用。我们观察到,现有的基于物体的视频识别框架要么假设存在域内监督的物体检测器,要么遵循完全弱监督流程从动作标签推断物体位置。我们提出通过利用视觉-语言预训练模型来构建物体中心视频表示。这通过“物体提示”实现,一种无需微调即可从通用预训练模型中提取任务特定物体中心表示的方法。为识别和预测人-物交互,我们使用基于 Transformer 的神经网络架构,其允许在不同时间尺度上“检索”相关物体以进行动作预测。我们在 Ego4D、50Salads 和 EGTEA Gaze+ 基准上进行了广泛评估。定量与定性结果均证实了我们所提方法的有效性。
引用
@article{arxiv.2311.00180,
title = {Object-centric Video Representation for Long-term Action Anticipation},
author = {Ce Zhang and Changcheng Fu and Shijie Wang and Nakul Agarwal and Kwonjoon Lee and Chiho Choi and Chen Sun},
journal= {arXiv preprint arXiv:2311.00180},
year = {2023}
}
备注
This is an accepted WACV 2024 paper. Our code is available at https://github.com/brown-palm/ObjectPrompt