探索 GLIDE 模型用于人体动作-效应预测
计算机视觉与模式识别
2022-08-03 v1 人工智能
摘要
我们解决如下动作-效应预测任务。给定一张描绘世界初始状态的图像以及以文本表达的动作,预测一张描绘该动作之后世界状态的图像。预测结果应与输入图像具有相同的场景上下文。我们探索使用最近提出的 GLIDE 模型来执行此任务。GLIDE 是一种生成式神经网络,能够以一段短文本为条件合成(修复)图像的被掩码区域。我们的想法是,在输入图像中掩码掉预期发生动作效应的区域。然后利用 GLIDE 以所需动作为条件修复该掩码区域。以此方式,所得图像具有与输入图像相同的背景上下文,并进行了更新以展示动作的效应。我们给出了使用带有动作标注的以自我为中心的视频数据集 EPIC 进行实验的定性结果。
引用
@article{arxiv.2208.01136,
title = {Exploring the GLIDE model for Human Action-effect Prediction},
author = {Fangjun Li and David C. Hogg and Anthony G. Cohn},
journal= {arXiv preprint arXiv:2208.01136},
year = {2022}
}