中文

一个动作值多个词:动作识别中的歧义处理

计算机视觉与模式识别 2022-10-12 v1

摘要

精确命名视频中描绘的动作可能是一项具有挑战性且常常模糊的任务。与表示为名词的物体实例(例如狗、猫、椅子等)不同,在动作的情况下,人类标注者通常对什么构成特定动作(例如慢跑与跑步)缺乏共识。实际上,给定视频可能包含同一动作的多个有效正标注。因此,视频数据集通常包含显著的标签噪声以及原子动作类之间的重叠。在本工作中,我们解决了仅使用单一正训练标签训练多标签动作识别模型的挑战。我们提出两种基于从训练集中相似实例采样生成伪训练样本的方法。与使用模型派生伪标签的其他方法不同,我们的伪标签来自人类标注,并基于特征相似性筛选。为验证我们的方法,我们通过手动用多个动词标签标注 EPIC-Kitchens-100 验证集的一个子集来创建新的评估基准。我们给出了在该新测试集上的结果,以及在一个称为 Confusing-HMDB-102 的 HMDB-51 新版本上的额外结果,在两种情况下均优于现有方法。数据与代码见 https://github.com/kiyoon/verb_ambiguity

关键词

引用

@article{arxiv.2210.04933,
  title  = {An Action Is Worth Multiple Words: Handling Ambiguity in Action Recognition},
  author = {Kiyoon Kim and Davide Moltisanti and Oisin Mac Aodha and Laura Sevilla-Lara},
  journal= {arXiv preprint arXiv:2210.04933},
  year   = {2022}
}

备注

BMVC 2022