回答视觉假设性问题:从动作到预测场景描述
计算机视觉与模式识别
2018-11-22 v2 计算与语言
机器学习
摘要
深入的场景描述和问答任务极大地拓展了当今场景理解定义的范围。尽管此类任务原则上开放-ended,当前的表述主要聚焦于仅描述所考虑场景的当前状态。相比之下,在本文中,我们关注同样以动作为条件的场景的未来状态。我们将此定位为一个问答任务,其中必须针对未来场景状态给出答案,给定当前场景的观测以及一个包含假设性动作的问题。我们的解决方案是一种混合模型,其将物理引擎集成到问答架构中,以预测由动作引起的物体-物体交互所导致的未来场景状态。我们在此极具挑战性的新问题上展示了初步结果,并与基线进行比较,其中我们优于完全数据驱动的端到端学习方法。
引用
@article{arxiv.1809.03707,
title = {Answering Visual What-If Questions: From Actions to Predicted Scene Descriptions},
author = {M. Wagner and H. Basevi and R. Shetty and W. Li and M. Malinowski and M. Fritz and A. Leonardis},
journal= {arXiv preprint arXiv:1809.03707},
year = {2018}
}
备注
Paper: 18 pages, 5 figures, 5 tables. Supplementary material: 3 pages, 1 figure, 1 table. To be published in VLEASE ECCV 2018 workshop