基于互信息估计与最大化的零样本骨架动作识别
计算机视觉与模式识别
2023-10-31 v1 多媒体
摘要
零样本骨架动作识别旨在于在可见类别数据上训练后识别未见类别的动作。关键是从可见类到未见类建立视觉与语义空间之间的联系。以往研究主要聚焦于将序列编码为单一特征向量,随后将特征映射到嵌入空间中的同一锚点。其性能受限于:1)忽视全局视觉/语义分布对齐,导致难以捕捉两空间间真实的相互依赖;2)忽视时间信息,因为富含动作线索的逐帧特征被直接池化为单一特征向量。我们提出一种基于互信息(MI)估计与最大化的新零样本骨架动作识别方法。具体而言,1)我们最大化视觉与语义空间间的 MI 以实现分布对齐;2)我们利用时间信息估计 MI,通过鼓励 MI 随观测帧数增多而增大。在三个大规模骨架动作数据集上的大量实验证实了方法的有效性。代码:https://github.com/YujieOuO/SMIE。
引用
@article{arxiv.2308.03950,
title = {Zero-shot Skeleton-based Action Recognition via Mutual Information Estimation and Maximization},
author = {Yujie Zhou and Wenwen Qiang and Anyi Rao and Ning Lin and Bing Su and Jiaqi Wang},
journal= {arXiv preprint arXiv:2308.03950},
year = {2023}
}
备注
Accepted by ACM MM 2023