FiLM:基于通用条件化层的视觉推理
计算机视觉与模式识别
2017-12-20 v2 人工智能
计算与语言
机器学习
摘要
我们为神经网络引入一种通用的条件化方法,称为 FiLM:特征式线性调制(Feature-wise Linear Modulation)。FiLM 层通过基于条件化信息的简单、逐特征仿射变换来影响神经网络计算。我们证明,FiLM 层对于视觉推理——回答需要多步骤、高层次过程的图像相关问题——极为有效,而这一任务对于不显式建模推理的标准深度学习方法而言一直很困难。具体而言,我们在视觉推理任务上展示,FiLM 层 1) 将 CLEVR 基准上的当前最优误差减半,2) 以连贯的方式调制特征,3) 对消融和架构修改具有鲁棒性,4) 能够从少量示例甚至零样本很好地泛化到具有挑战性的新数据。
引用
@article{arxiv.1709.07871,
title = {FiLM: Visual Reasoning with a General Conditioning Layer},
author = {Ethan Perez and Florian Strub and Harm de Vries and Vincent Dumoulin and Aaron Courville},
journal= {arXiv preprint arXiv:1709.07871},
year = {2017}
}
备注
AAAI 2018. Code available at http://github.com/ethanjperez/film . Extends arXiv:1707.03017