MRRC:基于 R-CNN 特征分布组合(FDC)的图像描述多角色表示交叉解释
机器学习
2020-02-18 v1 机器学习
摘要
尽管通过机器进行图像描述需要结构化学习与解释基础,但改进需要以有意义的方式对多上下文进行理解与处理。本研究将提供一种上下文组合的新概念,并将影响诸多应用将视觉特征作为对象、活动与事件描述的等价物来处理。我们的架构包含三个组件:特征分布组合(FDC)层注意力、多角色表示交叉(MRRC)注意力层与语言解码器。FDC 层注意力有助于从 RCNN 特征生成加权注意力,MRRC 注意力层充当中间表示处理并有助于生成下一词注意力,而语言解码器有助于估计句中下一可能词的出现似然。我们展示了 FDC、MRRC、区域对象特征注意力与强化学习在从图像生成更优描述的有效学习中的效用。我们的模型性能相较先前提升了 35.3%,并基于逻辑、更好可解释性与上下文建立了表示生成的新标准与理论。
引用
@article{arxiv.2002.06436,
title = {MRRC: Multiple Role Representation Crossover Interpretation for Image Captioning With R-CNN Feature Distribution Composition (FDC)},
author = {Chiranjib Sur},
journal= {arXiv preprint arXiv:2002.06436},
year = {2020}
}
备注
18 pages