中文

流式第一人称动作预期:一种评估方案与方法

计算机视觉与模式识别 2023-06-30 v1

摘要

第一人称动作预期旨在根据对过去的观察预测相机佩戴者将执行的未来动作。虽然关于未来的预测应在所预测事件发生之前可用,但大多数方法并未关注做出此类预测所需的计算时间。因此,当前的评估方案假设预测在输入视频被观测后立即可用,即假定运行时间可忽略不计,这可能导致过于乐观的评估。我们提出一种流式第一人称动作评估方案,其假设预测在线执行,并仅在模型处理完当前输入片段后才可用,而这取决于其运行时间。为在相同预测时域内评估所有模型,我们进而提出运行较慢的模型应基于提前采样的时间片段做出预测。基于模型运行时间会影响所考虑流式评估场景中性能的观测,我们进一步提出一种基于前馈 3D CNN 的轻量级动作预期模型,该模型使用知识蒸馏技术以及一种新颖的过去到未来蒸馏损失进行优化。在三个流行数据集 EPIC-KITCHENS-55、EPIC-KITCHENS-100 和 EGTEA Gaze+ 上的实验表明:(i) 所提评估方案相较于经典评估在最优方法上引发了不同的排序;(ii) 轻量级方法往往胜过计算开销更大的方法;(iii) 所提基于前馈 3D CNN 和知识蒸馏的模型在流式第一人称动作预期场景中优于当前最优方法。

关键词

引用

@article{arxiv.2306.16682,
  title  = {Streaming egocentric action anticipation: An evaluation scheme and approach},
  author = {Antonino Furnari and Giovanni Maria Farinella},
  journal= {arXiv preprint arXiv:2306.16682},
  year   = {2023}
}

备注

Published in Computer Vision and Image Understanding, 2023. arXiv admin note: text overlap with arXiv:2110.05386