中文

HAT:用于在线时间动作定位的历史增强锚点转换器

计算机视觉与模式识别 2024-08-14 v1

摘要

在线视频理解通常依赖于单个帧,导致逐帧预测。近期的进展如在线时间动作定位(OnTAL),将这种方法扩展到实例级预测。然而,现有方法主要关注短期上下文,忽略了历史信息。为此,我们提出了历史增强锚点转换器(HAT)框架用于OnTAL。通过整合历史上下文,我们的框架增强了长期与短期信息之间的协同作用,提高了锚点特征对分类和定位的质量。我们在程序性偶然(PREGO)数据集(EGTEA和EPIC)以及标准非PREGO OnTAL数据集(THUMOS和MUSES)上进行评估。结果表明,我们的模型在PREGO数据集上显著优于最新方法,在非PREGO数据集上实现相当或略微优于的性能,凸显了在程序性和偶然动作场景中利用长期历史的重要性。代码可在:https://github.com/sakibreza/ECCV24-HAT/获取。

关键词

引用

@article{arxiv.2408.06437,
  title  = {HAT: History-Augmented Anchor Transformer for Online Temporal Action Localization},
  author = {Sakib Reza and Yuexi Zhang and Mohsen Moghaddam and Octavia Camps},
  journal= {arXiv preprint arXiv:2408.06437},
  year   = {2024}
}

备注

Accepted to ECCV 2024