自我视角视频的零样本时序交互定位
计算机视觉与模式识别
2025-11-17 v4 人工智能
机器人学
摘要
在视频中定位人-物交互(HOI)动作是多项下游任务的基础,如人类行为分析和人机技能迁移。当前时序动作定位方法通常依赖标注的交互动作和物体类别进行优化,导致领域偏差和部署效率低下。尽管一些近期工作已借助大型视觉语言模型(VLMs)实现了零样本时序动作定位(ZS-TAL),但其粗粒度的估计和开环流程阻碍了时序交互定位(TIL)的进一步性能提升。为解决这些问题,我们提出了一种新颖的零样本TIL方法EgoLoc,用于定位自我视角视频中人-物交互抓取动作的时序。EgoLoc引入了一种自适应采样策略,为VLM推理生成合理的视觉提示。通过同时吸收2D和3D观测,它根据3D手部速度直接在HOI的可能接触/分离时间戳附近采样高质量初始猜测,从而实现高推理精度和效率。此外,EgoLoc从视觉和动态线索生成闭环反馈,进一步优化定位结果。在公开数据集和我们新提出的基准上的全面实验表明,EgoLoc在自我视角视频的时序交互定位方面优于现有最先进基线。我们已在https://github.com/IRMVLab/EgoLoc开源了代码和相关数据。
引用
@article{arxiv.2506.03662,
title = {Zero-Shot Temporal Interaction Localization for Egocentric Videos},
author = {Erhang Zhang and Junyi Ma and Yin-Dong Zheng and Yixuan Zhou and Hesheng Wang},
journal= {arXiv preprint arXiv:2506.03662},
year = {2025}
}
备注
Accepted to IROS 2025