面向视频问答任务的数据增强技术
计算机视觉与模式识别
2020-08-25 v1
摘要
视频问答(VideoQA)是一项要求模型分析并理解输入视频所给视觉内容、问题所给文本部分以及二者交互以产生有意义答案的任务。我们的工作聚焦于以第一人称视频为基础的自我中心视频问答(Egocentric VideoQA)任务,因其重要性可影响诸多领域,如社会辅助与工业培训。近期,一个名为 EgoVQA 的自我中心视频问答数据集已发布。鉴于其规模较小,模型易快速过拟合。为缓解此问题,我们提出若干增强技术,在所选基线上使最终准确率提升 5.5%。
引用
@article{arxiv.2008.09849,
title = {Data augmentation techniques for the Video Question Answering task},
author = {Alex Falcon and Oswald Lanz and Giuseppe Serra},
journal= {arXiv preprint arXiv:2008.09849},
year = {2020}
}
备注
16 pages, 5 figures; to be published in Egocentric Perception, Interaction and Computing (EPIC) Workshop Proceedings, at ECCV 2020