基于多任务三流网络的密集关系图像描述生成
计算机视觉与模式识别
2021-10-12 v3 人工智能
计算与语言
摘要
我们引入密集关系描述生成,一种新颖的图像描述任务,旨在针对视觉场景中物体间关系信息生成多条描述。关系描述为每个物体组合间每种关系提供显式描述。该框架在信息多样性与信息量上均具优势,从而达成基于关系的全面图像理解,例如关系候选框生成。针对物体间关系理解,词性(POS;即主-宾-谓类别)可作为引导描述中词语因果序列的宝贵先验信息。我们强制框架不仅学习生成描述,还理解每个词的 POS。为此,我们提出多任务三流网络(MTTSNet),其由三个负责各 POS 的循环单元组成,通过联合预测每词正确描述与 POS 进行训练。此外,我们发现以显式关系模块调制物体嵌入可提升 MTTSNet 性能。我们经大规模数据集与多项指标的广泛实验分析证明,所提模型能生成更多样且更丰富的描述。随后,我们展示了该框架在整体图像描述、场景图生成与检索任务上的应用。
引用
@article{arxiv.2010.03855,
title = {Dense Relational Image Captioning via Multi-task Triple-Stream Networks},
author = {Dong-Jin Kim and Tae-Hyun Oh and Jinsoo Choi and In So Kweon},
journal= {arXiv preprint arXiv:2010.03855},
year = {2021}
}
备注
IEEE TPAMI accepted. Journal extension of our CVPR 2019 paper ( arXiv:1903.05942 ). Source code : https://github.com/Dong-JinKim/DenseRelationalCaptioning