中文

TPsgtR:用于图像描述生成的神经-符号张量积场景图三元组表示

计算与语言 2019-11-25 v1 计算机视觉与模式识别 机器学习

摘要

若能用概念位置绑定来表述图表示的构造,则可改进图像描述生成。在本工作中,我们引入了一种利用从图像区域视觉信息导出的场景图的神经-符号编码来生成描述的新技术,称之为张量积场景图三元组表示(TPsgt_{sgt}R)。此前多数工作集中于识别图像中的对象特征,而我们引入了一种神经-符号嵌入,可将图像不同区域间已识别的关系嵌入具体形式,而非依赖模型去组合任意/所有组合。这些神经符号表示有助于更好地定义神经符号空间以用于神经符号注意力,并可转化为更好的描述。基于此思路,我们提出两种新架构(TPsgt_{sgt}R-TDBU与TPsgt_{sgt}R-sTDBU)进行比较,实验结果表明我们的方法优于其他模型,且生成的描述更全面自然。

关键词

引用

@article{arxiv.1911.10115,
  title  = {TPsgtR: Neural-Symbolic Tensor Product Scene-Graph-Triplet Representation for Image Captioning},
  author = {Chiranjib Sur},
  journal= {arXiv preprint arXiv:1911.10115},
  year   = {2019}
}