基于视频的上下文问答
计算与语言
2018-04-23 v1 计算机视觉与模式识别
摘要
本项目的主要目标是构建用于视频的上下文问答模型。现有方法为基于图像的问答提供了鲁棒模型,但我们旨在将该方法推广到视频。我们提出一种视频的图表示,能够处理整个视频中多种类型的查询。例如,若某一帧有一张男人和一只猫坐着的图像,它应能够处理诸如“猫相对于男人坐在哪里?”或“男人手里拿着什么?”之类的查询。它也应能回答与 temporal 关系相关的查询。
引用
@article{arxiv.1804.07399,
title = {Video based Contextual Question Answering},
author = {Akash Ganesan and Divyansh Pal and Karthik Muthuraman and Shubham Dash},
journal= {arXiv preprint arXiv:1804.07399},
year = {2018}
}