中文

基于视频的上下文问答

计算与语言 2018-04-23 v1 计算机视觉与模式识别

摘要

本项目的主要目标是构建用于视频的上下文问答模型。现有方法为基于图像的问答提供了鲁棒模型,但我们旨在将该方法推广到视频。我们提出一种视频的图表示,能够处理整个视频中多种类型的查询。例如,若某一帧有一张男人和一只猫坐着的图像,它应能够处理诸如“猫相对于男人坐在哪里?”或“男人手里拿着什么?”之类的查询。它也应能回答与 temporal 关系相关的查询。

关键词

引用

@article{arxiv.1804.07399,
  title  = {Video based Contextual Question Answering},
  author = {Akash Ganesan and Divyansh Pal and Karthik Muthuraman and Shubham Dash},
  journal= {arXiv preprint arXiv:1804.07399},
  year   = {2018}
}