你做我学:基于无监督多用户第一人称视角的视频指导方法
计算机视觉与模式识别
2016-03-22 v2
摘要
本文提出一种无监督方法,用于从多用户执行任务时收集的第一人称视频和可穿戴注视跟踪中,自动提取关于物体使用的基于视频的指导。该方法 i) 发现任务相关物体,ii) 为每个物体建立模型,iii) 区分每个被发现物体的不同使用方式,iv) 发现物体交互之间的依赖关系。该工作研究利用外观、位置、运动和注意力,并给出了使用每种特征及组合特征的结果。此外,提出了一种在线可扩展方法并与离线结果进行比较。本文提出一种方法,用于为新手用户选择合适的视频指导以指示如何使用物体,纯粹由用户注视触发。潜在的辅助模式还可基于学习到的物体交互序列推荐下一个要使用的物体。该方法在多种日常任务上进行了测试,如初始化打印机、准备咖啡和设置健身器材。
引用
@article{arxiv.1510.04862,
title = {You-Do, I-Learn: Unsupervised Multi-User egocentric Approach Towards Video-Based Guidance},
author = {Dima Damen and Teesid Leelasawassuk and Walterio Mayol-Cuevas},
journal= {arXiv preprint arXiv:1510.04862},
year = {2016}
}