Ego4D 短期对象交互预测挑战的 VISTA 技术报告
计算机视觉与模式识别
2026-05-21 v1 人工智能
摘要
我们提出了 VISTA,一个集成于 V-JEPA 的 StillFast 风格短期对象交互预测器,用于 EgoVis 2026 的 Ego4D 短期对象交互预测(STA)挑战。给定 egocentric 视频时间戳,该任务要求预测下一个人类-对象交互,包括未来活跃对象的边界框、名词类别、动词类别、接触时间以及置信度得分。VISTA 遵循 StillFast 风格的设计,将对象中心的空间检测与短期时序背景相结合。具体而言,一个预训练的 COCO Faster R-CNN ResNet-50 FPN 检测器从最后观察到的高分辨率帧中生成对象提议,而一个冻结的 V-JEPA 2.1 时序分支从观察到的视频中提取 clip 级别的 egocentric 背景。将时序表示注入检测路径通过特征调制和 ROI 级别的背景融合。随后,融合后的提议特征被传递给多头 STA 预测器,用于边界框细化、名词分类、动词分类、接触时间回归以及交互置信度估计。对于最终提交,我们进一步对补充预测进行集成以提高鲁棒性。实验结果显示,VISTA 在EgoVis 2026 Ego4D STA 挑战中取得第一名。我们的代码将在 https://github.com/CorrineQiu/VISTA 上发布。
引用
@article{arxiv.2605.20901,
title = {VISTA: Technical Report for the Ego4D Short-Term Object Interaction Anticipation at EgoVis 2026},
author = {Qiaohui Chu and Haoyu Zhang and Yisen Feng and Meng Liu and Weili Guan and Dongmei Jiang and Liqiang Nie},
journal= {arXiv preprint arXiv:2605.20901},
year = {2026}
}
备注
The champion solution for the Ego4D Short-Term Object Interaction Anticipation Challenge at the CVPR EgoVis Workshop 2026