长时序过程视频中的物体状态变化预测
计算机视觉与模式识别
2024-12-03 v3
摘要
在本工作中,我们引入了 项内容: 过程活动中图像与视频内物体状态变化预测的新问题; 基于 Ego4D 数据集的物体状态变化分类的新精选标注数据; 解决这一挑战性问题的首个方法。这一新任务的解决方案对基于视觉的场景理解、自动监测系统和动作规划具有重要意义。所提出的新颖框架通过将代表近期视觉信息的已学习视觉特征与代表过去物体状态变化和动作的自然语言(NLP)特征相整合,预测由尚未观察到的人类动作在近期内引发的物体状态变化。利用提供跨越众多交互场景的大规模第一人称视角视频集合的广泛且具挑战性的 Ego4D 数据集,我们引入了一个名为 Ego4D-OSCA 的扩展,为物体状态变化预测任务(OSCA)提供了新的精选标注数据。我们进行了广泛的实验评估,展示了所提出方法在动态场景中预测物体状态变化的有效性。所提方法的性能也突显了整合视频与语言线索以增强视频理解系统预测性能的潜力,并为未来关于物体状态变化预测新任务的研究奠定了基础。源代码和新标注数据 将公开发布。
引用
@article{arxiv.2405.12789,
title = {Anticipating Object State Changes in Long Procedural Videos},
author = {Victoria Manousaki and Konstantinos Bacharidis and Filippos Gouidis and Konstantinos Papoutsakis and Dimitris Plexousakis and Antonis Argyros},
journal= {arXiv preprint arXiv:2405.12789},
year = {2024}
}