密集关系描述生成:基于三重流网络的关系式字幕生成
计算机视觉与模式识别
2019-09-24 v4 计算与语言
摘要
本工作的目标是训练一个生成更密集且更具信息量的图像字幕的模型。我们引入“关系描述生成”,一种新颖的图像字幕任务,旨在针对图像中物体间的关系信息生成多个字幕。关系描述生成是一个在多样性和信息量上均具优势的框架,可导向基于关系的图像理解。词性(POS,即主-谓-宾类别)标签可赋予每个英文单词。我们利用 POS 作为先验来引导字幕中正确的词序。为此,我们提出了一种多任务三重流网络(MTTSNet),其由分别对应 POS 的三个循环单元组成,并联合执行 POS 预测与字幕生成。我们展示了所提模型相较若干基线及竞争方法生成了更多样且更丰富的表示。
引用
@article{arxiv.1903.05942,
title = {Dense Relational Captioning: Triple-Stream Networks for Relationship-Based Captioning},
author = {Dong-Jin Kim and Jinsoo Choi and Tae-Hyun Oh and In So Kweon},
journal= {arXiv preprint arXiv:1903.05942},
year = {2019}
}
备注
CVPR 2019 (Under review for journal extension). Project page : https://sites.google.com/view/relcap