中文

用于可控图像描述的语言驱动区域指针推进

计算与语言 2020-12-01 v1 计算机视觉与模式识别 机器学习 神经与进化计算

摘要

可控图像描述(Controllable Image Captioning)是图像描述这一多模态任务中新兴的子领域,其对生成的自然语言描述中应描述图像中哪些区域施加了约束。这更加强调生成更细致的描述,并为终端用户提供更多对结果的控制。可控图像描述架构的一个关键组成部分是通过区域指针推进来决定关注每个区域的时机的机制。在本文中,我们提出了一种预测区域指针推进时机的新方法,受训练数据中与句子结构的强相关性启发,将推进步骤通过 NEXT 标记作为语言结构的自然部分来处理。我们发现,我们的时机与 Flickr30k Entities 测试数据中的真值时机一致,精确率为 86.55%,召回率为 97.92%。我们实现该技术的模型在标准描述指标上提升了 SOTA,同时展现出显著更大的有效词汇量。

关键词

引用

@article{arxiv.2011.14901,
  title  = {Language-Driven Region Pointer Advancement for Controllable Image Captioning},
  author = {Annika Lindh and Robert J. Ross and John D. Kelleher},
  journal= {arXiv preprint arXiv:2011.14901},
  year   = {2020}
}

备注

Accepted to COLING 2020