中文

面向第一人称视频活动预测的自调节学习

计算机视觉与模式识别 2021-11-24 v1

摘要

未来活动预测是第一人称视觉中的一个挑战性问题。作为标准的未来活动预测范式,递归序列预测存在误差累积问题。为解决该问题,我们提出了一种简单有效的自调节学习(Self-Regulated Learning, SRL)框架,旨在连续调节中间表示以产生这样的表示:(a) 相较于先前已观测内容,强调当前时间戳帧中的新颖信息;(b) 反映其与先前已观测帧的相关性。前者通过最小化对比损失实现,后者可通过动态重加权机制实现,该机制借助当前帧特征与已观测帧之间的相似性比较来关注已观测内容中的信息帧。所学得的最终视频表示可进一步通过多任务学习增强,该学习在目标活动标签与自动检测的动作及物体类别标记上执行联合特征学习。SRL 在两个第一人称视频数据集和两个第三人称视频数据集上的大多数情况下大幅优于现有 SOTA。其有效性亦由以下实验事实得到验证:支撑活动语义的动作与物体概念可被准确识别。

关键词

引用

@article{arxiv.2111.11631,
  title  = {Self-Regulated Learning for Egocentric Video Activity Anticipation},
  author = {Zhaobo Qi and Shuhui Wang and Chi Su and Li Su and Qingming Huang and Qi Tian},
  journal= {arXiv preprint arXiv:2111.11631},
  year   = {2021}
}