OpenTAL:面向开放集时序动作定位
计算机视觉与模式识别
2022-03-11 v1
摘要
时序动作定位(TAL)在监督学习范式下取得了显著成功。然而,现有 TAL 方法根植于封闭集假设,无法处理开放世界场景中不可避免未知动作。本文首次迈向开放集 TAL(OSTAL)问题,并基于证据深度学习(EDL)提出通用框架 OpenTAL。具体而言,OpenTAL 由不确定性感知动作分类、动作性预测和时序位置回归组成。所提出的基于重要性平衡的 EDL 方法通过主要从重要样本收集类别证据来学习分类不确定性。为区分未知动作与背景视频帧,动作性通过正-未标记学习来学习。通过利用时序定位质量的引导进一步校准分类不确定性。OpenTAL 具有通用性,可使现有 TAL 模型适用于开放集场景,在 THUMOS14 和 ActivityNet1.3 基准上的实验结果展示了我们方法的有效性。代码与预训练模型发布于 https://www.rit.edu/actionlab/opental。
引用
@article{arxiv.2203.05114,
title = {OpenTAL: Towards Open Set Temporal Action Localization},
author = {Wentao Bao and Qi Yu and Yu Kong},
journal= {arXiv preprint arXiv:2203.05114},
year = {2022}
}
备注
CVPR 2022 [camera ready with supplement]