利用带文本描述的人工指令改进零样本动作识别
计算机视觉与模式识别
2023-06-13 v2
摘要
零样本动作识别可在未接收任何训练样本的情况下识别视频中的动作,因能节省人力成本与训练时间而受到广泛关注。然而,零样本学习的性能仍不尽如人意,限制了其实用性。为解决此问题,本研究提出一种利用带文本描述的人工指令改进零样本动作识别的框架。所提框架手动描述视频内容,这会产生一定人力成本;但在许多情形下,该人力成本是值得的。我们为每个动作手动标注文本特征,其可为单词、短语或句子。随后通过计算视频与所有文本特征间的匹配程度,可预测视频类别。此外,所提模型亦可与其他模型结合以提升准确率。并且,我们的模型可通过重复人工指令持续优化以提高精度。在 UCF101 和 HMDB51 上的结果表明,我们的模型取得了最佳准确率,并提升了其他模型的准确率。
引用
@article{arxiv.2301.08874,
title = {Improving Zero-Shot Action Recognition using Human Instruction with Text Description},
author = {Nan Wu and Hiroshi Kera and Kazuhiko Kawamoto},
journal= {arXiv preprint arXiv:2301.08874},
year = {2023}
}
备注
18 pages, 9 figures