基于多跳特征调制的视觉推理
计算机视觉与模式识别
2018-10-15 v2 计算与语言
机器学习
机器学习
摘要
计算机视觉与自然语言处理的近期突破激发了人们对视觉问答与视觉对话等挑战性多模态任务的兴趣。对于此类任务,一种成功方法是通过特征级线性调制(FiLM)层(即逐通道缩放与偏移)使基于图像的卷积网络计算以语言为条件。我们提出以多跳方式而非如先前工作那样一次性地,在卷积网络层级向上生成FiLM层参数。通过在关注语言输入与生成FiLM层参数之间交替,该方法能更好地扩展到具有更长输入序列(如对话)的设置。我们证明多跳FiLM生成在短输入序列任务ReferIt上达到最优性能——与单跳FiLM生成相当——同时在GuessWhat?!视觉对话任务上显著优于先前最优与单跳FiLM生成。
引用
@article{arxiv.1808.04446,
title = {Visual Reasoning with Multi-hop Feature Modulation},
author = {Florian Strub and Mathieu Seurin and Ethan Perez and Harm de Vries and Jérémie Mary and Philippe Preux and Aaron Courville and Olivier Pietquin},
journal= {arXiv preprint arXiv:1808.04446},
year = {2018}
}
备注
In Proc of ECCV 2018