厨房烹饪:视频中人类活动的识别与分割
计算机视觉与模式识别
2016-03-18 v2
摘要
随着动作识别研究的成熟,研究重点正从使用人工分割的视频数据集对基本任务导向动作进行分类,转向在真实世界场景中理解复杂目标导向的日常人类活动。时序结构化模型似乎是解决这一系列问题的明显选择,但到目前为止,这些模型优于更简单的非结构化词袋类型模型的案例仍然很少。随着大型人类活动数据集的日益增多,加上能够产生更紧凑表示的新型特征编码技术的发展,现在是重新审视结构化生成方法的时候了。在这里,我们描述了一种端到端的生成方法,通过应用 Fisher 向量和时序模型分析视频序列,从特征编码到复杂人类活动的结构化建模。我们在多个可用数据集(ADL、MPIICooking 和 Breakfast 数据集)上使用多种性能指标对所提出的方法进行了系统评估。通过广泛的系统评估,我们证明将基于 Fisher 向量的紧凑视频表示与基于 HMM 的建模相结合,可带来非常显著的准确率提升;并且在用充足训练样本进行适当训练后,结构化时序模型在所测试的性能指标上大幅优于非结构化词袋类型模型。
引用
@article{arxiv.1508.06073,
title = {Cooking in the kitchen: Recognizing and Segmenting Human Activities in Videos},
author = {Hilde Kuehne and Juergen Gall and Thomas Serre},
journal= {arXiv preprint arXiv:1508.06073},
year = {2016}
}
备注
15 pages, 12 figures