为常识零样本动作识别讲述故事
计算机视觉与模式识别
2024-10-24 v2
摘要
视频理解长期受限于对大型标注数据集的依赖,推动了零样本学习的研究。近期语言建模的进展为推进零样本视频分析带来机遇,但构建关联动作类的有效语义空间仍具挑战。为此,我们引入了一个新颖数据集Stories,其包含从WikiHow文章中提取的针对多样动作类的丰富文本描述。对于每个类,我们提取多句叙述,详述表征该动作所需的步骤、场景、物体与动词。该上下文数据实现了动作间细微关系的建模,为零样本迁移铺平道路。我们还提出一种利用Stories改进特征生成以训练零样本分类的方法。无需任何目标数据集微调,我们的方法在多个基准上取得新的state-of-the-art,将top-1准确率提升至多6.1%。我们相信Stories提供了宝贵资源,可催化零样本动作识别的进步。文本叙述在已见与未见类间建立联系,克服了长期阻碍该领域进展的标注数据瓶颈。数据可在如下地址获取:https://github.com/kini5gowda/Stories 。
引用
@article{arxiv.2309.17327,
title = {Telling Stories for Common Sense Zero-Shot Action Recognition},
author = {Shreyank N Gowda and Laura Sevilla-Lara},
journal= {arXiv preprint arXiv:2309.17327},
year = {2024}
}
备注
Accepted in ACCV 2024!