面向多样化图像描述中意图建模的序列化潜在空间
计算机视觉与模式识别
2019-08-23 v1 计算与语言
机器学习
机器学习
摘要
多样化且准确的视觉+语言建模是保持创作自由度和维持用户参与度的重要目标。然而,充分捕捉语言模型中多样性的复杂性颇具挑战。近期工作通常借助潜在变量模型,并辅以来自目标检测器或词性标注的或多或少的监督。所有这些方法的共同点是,潜在变量要么仅初始化句子生成过程,要么在生成各步骤中保持相同。这两种方法都无法提供细粒度控制。为解决这一问题,我们提出 Seq-CVAE,它为每个词位置学习一个潜在空间。我们通过模拟一个概括未来信息的表征,促使这一时序潜在空间捕捉关于如何完成句子的“意图”。我们在具有挑战性的 MSCOCO 数据集上展示了所提方法在预测句子延续方面的有效性,与基线相比显著提升了多样性指标,同时在句子质量方面表现相当。
引用
@article{arxiv.1908.08529,
title = {Sequential Latent Spaces for Modeling the Intention During Diverse Image Captioning},
author = {Jyoti Aneja and Harsh Agrawal and Dhruv Batra and Alexander Schwing},
journal= {arXiv preprint arXiv:1908.08529},
year = {2019}
}
备注
Accepted to ICCV 2019