中文

基于语义角色的视频短语问答

计算机视觉与模式识别 2021-04-09 v1 计算与语言

摘要

视频问答(VidQA)的评估指标一直局限于单字答案或从固定短语集中选择短语。这些指标限制了 VidQA 模型的应用场景。在本工作中,我们利用从视频描述中导出的语义角色来掩盖某些短语,从而提出 VidQAP,将 VidQA 构建为填短语任务。为支持对答案短语的评估,我们计算预测答案相对于空字符串的相对提升。为减少 VidQA 数据集中语言偏差的影响,我们检索对同一问题具有不同答案的视频。为促进研究,我们构建了 ActivityNet-SRL-QA 和 Charades-SRL-QA,并通过扩展三种视觉-语言模型对它们进行基准测试。我们进一步进行了广泛的分析与消融研究以指导未来工作。

关键词

引用

@article{arxiv.2104.03762,
  title  = {Video Question Answering with Phrases via Semantic Roles},
  author = {Arka Sadhu and Kan Chen and Ram Nevatia},
  journal= {arXiv preprint arXiv:2104.03762},
  year   = {2021}
}

备注

NAACL21 Camera Ready including appendix