用于动作识别的人-物交互上下文蒸馏
计算机视觉与模式识别
2021-12-20 v1
摘要
建模时空关系对于识别人类动作至关重要,特别是当人与物体交互且多个物体随时间以不同方式出现在人体周围时。大多数现有的动作识别模型侧重于学习场景的整体视觉线索,却忽视了可通过学习人-物关系与交互获得的具有信息量的细粒度特征。在本文中,我们通过利用人与物体的局部与全局上下文的交互来学习人-物关系。因此我们提出全局-局部交互蒸馏网络(GLIDN),通过知识蒸馏在空间和时间上学习人与物体的交互以实现细粒度场景理解。GLIDN将人和物体编码为图节点,并通过图注意力网络学习局部和全局关系。局部上下文图通过在特定时间步捕获人与物体的共现来学习帧级别上人与物体的关系。全局关系图基于视频级别的人与物体交互构建,识别其在整个视频序列中的长期关系。更重要的是,我们研究了如何将这些图中的知识蒸馏到其对应部分以改进人-物交互(HOI)识别。我们在包括Charades和CAD-120数据集的两个数据集上通过综合实验评估了我们的模型。我们取得了比基线及同类方法更好的结果。
引用
@article{arxiv.2112.09448,
title = {Distillation of Human-Object Interaction Contexts for Action Recognition},
author = {Muna Almushyti and Frederick W. Li},
journal= {arXiv preprint arXiv:2112.09448},
year = {2021}
}