First-Take-All:面向 3D 动作视频的时间顺序保持哈希
计算机视觉与模式识别
2015-06-09 v1
摘要
随着商用深度摄像头的普及,基于 3D 运动捕捉与识别的用户界面新范式已极大地改变了人与计算机的交互方式。人体动作识别作为这些设备中的关键组件之一,对保证用户体验质量起着重要作用。尽管模型驱动的方法已取得巨大成功,它们无法为大规模应用中的高效存储、检索和识别动作提供可扩展的解决方案。这些模型还易受时间平移与扭曲以及运动尺度和执行速率变化的影响。为应对这些挑战,我们提议将 3D 人体动作识别视为视频级哈希问题,并提出一种新颖的 First-Take-All (FTA) 哈希算法,能够将整个视频哈希为固定长度的哈希码。我们证明该 FTA 算法生成视频的紧凑表示,对上述变化保持不变性,借此可通过 FTA 哈希码之间的汉明距离的高效最近邻搜索来解决动作识别。在公开 3D 人体动作数据集上的实验表明,考虑到数据集中每个视频约 65 帧,FTA 算法可达到高于 80% 的识别准确率,每帧约 15 比特。
引用
@article{arxiv.1506.02184,
title = {First-Take-All: Temporal Order-Preserving Hashing for 3D Action Videos},
author = {Jun Ye and Hao Hu and Kai Li and Guo-Jun Qi and Kien A. Hua},
journal= {arXiv preprint arXiv:1506.02184},
year = {2015}
}
备注
9 pages, 11 figures