中文

基于动态模态注意的传感器增强第一人称视频描述

计算机视觉与模式识别 2021-09-08 v1

摘要

自动描述视频(即视频描述)已在多媒体领域被广泛研究。本文提出了传感器增强第一人称视频描述这一新任务、为其构建的新数据集 MMAC Captions,以及一种针对该新任务的方法,该方法有效利用视频与运动传感器(即惯性测量单元,IMUs)的多模态数据。尽管传统视频描述任务因固定摄像机的有限视野难以处理人类活动的细致描述,第一人称视觉基于更近的视野在生成更细粒度人类活动描述方面具有更大潜力。此外,我们利用可穿戴传感器数据作为辅助信息,以缓解第一人称视觉的固有问题:运动模糊、自遮挡和超出摄像机范围的活动。我们提出了一种基于注意力机制有效结合传感器数据与视频数据的方法,该机制动态确定需要更多关注的模态,同时考虑上下文信息。我们在 MMAC Captions 数据集上将所提传感器融合方法与强基线进行比较,发现将传感器数据作为第一人称视频数据的补充信息是有益的,且我们所提方法优于强基线,证明了方法的有效性。

关键词

引用

@article{arxiv.2109.02955,
  title  = {Sensor-Augmented Egocentric-Video Captioning with Dynamic Modal Attention},
  author = {Katsuyuki Nakamura and Hiroki Ohashi and Mitsuhiro Okada},
  journal= {arXiv preprint arXiv:2109.02955},
  year   = {2021}
}

备注

Accepted to ACM Multimedia (ACMMM) 2021