用于手势视频分类的多分辨率匹配核
计算机视觉与模式识别
2017-06-26 v1
摘要
Microsoft Kinect 等深度成像技术的出现,重新激发了人们对基于视频的手势分类计算方法的研究兴趣。多年来,研究人员一直使用词袋特征作为从视频数据生成特征向量以识别手势的主要方法。然而,BoF 方法对视频中的信息表示较为粗糙,通常会导致视频间的相似性度量不佳。此外,在 BoF 方法中,当从视频中不同时空位置提取的特征被池化以创建直方图向量时,其原始的空间和时间位置信息会存在内在的丢失。本文提出了一种用于视频分类的多分辨率匹配核(MMK),可视为 BoF 方法的推广。我们将该流程应用于基于美国手语(ASL)手势 RGB-D 视频的手势分类,结果展示了这一新方法的潜力与实用性。
引用
@article{arxiv.1706.07530,
title = {Multiresolution Match Kernels for Gesture Video Classification},
author = {Hemanth Venkateswara and Vineeth N. Balasubramanian and Prasanth Lade and Sethuraman Panchanathan},
journal= {arXiv preprint arXiv:1706.07530},
year = {2017}
}
备注
ICME 2013 Conference