中文

图像描述生成中的物体幻觉

计算与语言 2019-04-02 v2 计算机视觉与模式识别

摘要

尽管性能持续提升,当代图像描述生成模型易于“幻觉”出场景中实际不存在的物体。一个问题是标准指标仅衡量与真实描述文本的相似度,可能无法充分捕捉图像相关性。在本工作中,我们提出一种新的图像相关性指标,以使用真实视觉标签评估当前模型并评估其物体幻觉率。我们分析图像描述生成模型架构和学习目标如何导致物体幻觉,探究幻觉何时可能由图像误分类或语言先验引起,并评估当前句子指标在多大程度上捕捉物体幻觉。我们在标准图像描述生成基准 MSCOCO 上使用一组多样化模型研究这些问题。我们的分析得出若干有趣发现,包括在标准句子指标上得分最佳的模型并不总是具有更低的幻觉率,且幻觉更多的模型往往犯由语言先验驱动的错误。

关键词

引用

@article{arxiv.1809.02156,
  title  = {Object Hallucination in Image Captioning},
  author = {Anna Rohrbach and Lisa Anne Hendricks and Kaylee Burns and Trevor Darrell and Kate Saenko},
  journal= {arXiv preprint arXiv:1809.02156},
  year   = {2019}
}

备注

Rohrbach and Hendricks contributed equally; accepted to EMNLP 2018