学习描述相似图像对之间的差异
计算与语言
2018-09-03 v1 计算机视觉与模式识别
摘要
本文提出自动生成文本以描述两幅相似图像之间差异的任务。我们通过众包为从视频监控录像中提取的成对面帧收集差异描述数据集。标注者被要求用简短段落简洁描述所有差异。因此,我们的新数据集为探索视觉与语言对齐模型以及捕捉视觉显著性提供了机会。该数据集也可作为连贯多句生成的实用基准。我们进行了初步的视觉分析,将差异像素簇作为对象级差异的代理。我们提出一种利用潜变量将差异像素簇与输出句子对齐以捕捉视觉显著性的模型。我们发现,无论在单句生成还是多句生成中,所提模型均优于仅使用注意力的模型。
引用
@article{arxiv.1808.10584,
title = {Learning to Describe Differences Between Pairs of Similar Images},
author = {Harsh Jhamtani and Taylor Berg-Kirkpatrick},
journal= {arXiv preprint arXiv:1808.10584},
year = {2018}
}
备注
EMNLP 2018