面向早期动作预测的富动作语义一致知识
计算机视觉与模式识别
2023-12-21 v3
摘要
早期动作预测(EAP)旨在从进行中视频的部分动作执行中识别人类动作,这是许多实际应用中的一项重要任务。大多数先前工作将部分或完整视频作为整体处理,忽略了视频中隐藏的丰富动作知识,即不同部分视频之间的语义一致性。相反,我们划分原始部分或完整视频以形成一系列新的部分视频,并挖掘这些处于任意进度层级的新部分视频之间的动作语义一致知识(ASCK)。此外,提出了一种在师生框架下的新颖富动作语义一致知识网络(RACK)用于EAP。首先,我们使用双流预训练模型提取视频特征。其次,我们将部分视频的RGB或光流特征作为节点,将其动作语义一致性作为边。接下来,我们为教师网络构建双向语义图,为学生网络构建单向语义图,以建模部分视频间丰富的ASCK。将MSE和MMD损失作为我们的蒸馏损失,以将部分视频的ASCK从教师网络丰富到学生网络。最后,我们通过求和不同子网络的logits并应用softmax层获得最终预测。进行了大量实验和消融研究,证明了建模丰富ASCK对EAP的有效性。借助所提出的RACK,我们在三个基准上取得了SOTA性能。代码可在 https://github.com/lily2lab/RACK.git 获取。
引用
@article{arxiv.2201.09169,
title = {Rich Action-semantic Consistent Knowledge for Early Action Prediction},
author = {Xiaoli Liu and Jianqin Yin and Di Guo and Huaping Liu},
journal= {arXiv preprint arXiv:2201.09169},
year = {2023}
}
备注
Accepted by IEEE TIP,15pages