EgoLoc:面向 egocentric 视频中时序互动定位的通用方法
计算机视觉与模式识别
2025-08-19 v1
摘要
分析手部-物体互动有助于 VR/AR 应用和人类-机器人策略迁移。现有研究主要聚焦于建模交互式动作的行为范式(即“如何与之交互”),但捕捉手部与目标物体接触和分离的关键时刻的更具挑战性和细粒度的问题仍未得到充分探索,这对于混合现实中的沉浸式交互体验和机器人运动规划至关重要。因此,我们将此问题建模为时序互动定位 (TIL)。一些最近的工作提取语义掩码作为 TIL 参考,但受限于对象定位不准和场景杂乱。虽然当前的时序动作定位 (TAL) 方法在检测动词-名词动作片段方面表现良好,但依赖类别注释进行训练,并在定位手部-物体接触/分离时刻方面精度有限。为解决这些问题,我们提出一种称为 EgoLoc 的零样本方法,用于在 egocentric 视频中定位手部-物体接触和分离的时间戳。EgoLoc 引入手部动力学引导的采样以生成高质量的视觉提示。它利用视觉-语言模型识别接触/分离属性、局化特定时间戳,并提供用于进一步细化的闭环反馈。EgoLoc 消除了对象掩码和动词-名词分类的需求,实现了通用的零样本实现。全面的实验在公共数据集和我们新的基准数据集上表明,EgoLoc 能够为 egocentric 视频实现合理的 TIL。它也被验证有效地促进了 egocentric 视觉和机器人操作任务中的多个下游应用。代码和相关数据将发布于 https://github.com/IRMVLab/EgoLoc。
引用
@article{arxiv.2508.12349,
title = {EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos},
author = {Junyi Ma and Erhang Zhang and Yin-Dong Zheng and Yuchen Xie and Yixuan Zhou and Hesheng Wang},
journal= {arXiv preprint arXiv:2508.12349},
year = {2025}
}
备注
Extended journal version of arXiv:2506.03662