中文

时序上下文一致性: 通过学习和强制时序约束提升长期 anticipation

计算机视觉与模式识别 2024-12-30 v1

摘要

本文提出一种方法用于长期动作 anticipation (LTA),即在给定初始未裁剪视频区间的观察后,预测动作标签及其持续时间。我们基于编码器-解码器架构进行开发,采用并行解码。我们的两个关键贡献首先,在解码器顶部引入双向动作上下文正则化模块,以确保相邻时段的时序上下文连贯性。其次,我们从分类的片段中学习转换矩阵,用于建模从一种动作到另一种动作的转换概率,并对整个预测区间进行全局优化。在此基础上,我们使用专用于动作分割的专用编码器,以提高推断期间观察区间预测质量,从而更好地理解过去。在四个 LTA 基准数据集上进行验证:EpicKitchen-55、EGTEA+、50Salads 和 Breakfast,结果显示我们的方法在准确率或性能上优于或相当于最先进的方法,包括基于概率模型和基于大型语言模型的方法,这些方法假设输入为裁剪后的视频。代码将在接受后公开。

关键词

引用

@article{arxiv.2412.19424,
  title  = {Temporal Context Consistency Above All: Enhancing Long-Term Anticipation by Learning and Enforcing Temporal Constraints},
  author = {Alberto Maté and Mariella Dimiccoli},
  journal= {arXiv preprint arXiv:2412.19424},
  year   = {2024}
}