手边之物:基于手-物交互的混合现实视频引导自动剪辑
计算机视觉与模式识别
2021-10-01 v1
摘要
本文关注如何自动提取构成真实生活手部活动的步骤这一问题。这是混合现实系统中进行处理、监控与提供视频引导的一项关键能力。我们利用自我中心视觉观察真实任务中的手-物交互,并自动将视频分解为其组成步骤。我们的方法结合手-物交互(HOI)检测、物体相似度度量与有限状态机(FSM)表示,以自动将视频剪辑为步骤。我们结合卷积神经网络(CNN)与 FSM,在观察真实手部活动的同时发现、剪辑切点并合并片段。我们在两个数据集上对我们的算法进行了定量与定性评估:GTEA\cite{li2015delving},以及我们新引入的中国茶艺制作数据集。结果表明,我们的方法能够以较高精度将手-物交互视频分割为关键步骤片段。
引用
@article{arxiv.2109.14744,
title = {The Object at Hand: Automated Editing for Mixed Reality Video Guidance from Hand-Object Interactions},
author = {Yao Lu and Walterio W. Mayol-Cuevas},
journal= {arXiv preprint arXiv:2109.14744},
year = {2021}
}