人类动作副词识别:ADHA数据集与三流混合模型
计算机视觉与模式识别
2018-02-13 v2
摘要
我们针对一个新问题引入了首个基准——识别人类动作副词(HAA):“描述人类动作的副词”(ADHA)。这是计算机视觉从模式识别转向真正人工智能的第一步。我们展示了ADHA的一些关键特征:一组语义完备的描述人类动作的副词、一组常见的可描述人类动作,以及对每个视频中同时出现的动作的详尽标注。我们深入分析了当前动作识别与图像字幕生成中有效模型在副词识别上的实现,结果表明此类方法不尽如人意。此外,我们提出了一种新颖的三流混合模型来处理HAA问题,取得了更好的结果。
引用
@article{arxiv.1802.01144,
title = {Human Action Adverb Recognition: ADHA Dataset and A Three-Stream Hybrid Model},
author = {Bo Pang and Kaiwen Zha and Cewu Lu},
journal= {arXiv preprint arXiv:1802.01144},
year = {2018}
}