通过度量动词-副词文本关系学习动作变化
计算机视觉与模式识别
2023-05-24 v2
摘要
本工作的目标是理解视频中动作的执行方式。即,给定一段视频,我们旨在预测一个表示施加于动作上的修饰的副词(例如“细”切)。我们将此问题视为回归任务。我们度量动词与副词间的文本关系以生成代表待学动作变化的回归目标。我们在一系列数据集上测试了方法,并在副词预测和反义词分类上均取得最先进结果。此外,当我们解除两个常被假设的约束——测试时动作标签可用性和副词成对为反义词——时,表现优于先前工作。现有的副词识别数据集要么含噪导致学习困难,要么包含外观不受副词影响的动作导致评估可靠性低。为此,我们收集了一个高质量新数据集:食谱中的副词(AIR)。我们聚焦于教学食谱视频,筛选出以不同方式执行时呈现有意义视觉变化的动作集合。AIR 中视频裁剪更紧凑且经多名标注者人工审核以确保高标注质量。结果显示模型从其更干净视频中学习效果更好。同时,AIR 上的副词预测具挑战性,表明仍有相当改进空间。
引用
@article{arxiv.2303.15086,
title = {Learning Action Changes by Measuring Verb-Adverb Textual Relationships},
author = {Davide Moltisanti and Frank Keller and Hakan Bilen and Laura Sevilla-Lara},
journal= {arXiv preprint arXiv:2303.15086},
year = {2023}
}
备注
CVPR 23. Version 2 updates some results due to an errata (see code repository for more details). Code and dataset available at https://github.com/dmoltisanti/air-cvpr23