中文

IC3:基于委员会共识的图像描述生成

计算机视觉与模式识别 2023-10-20 v3 人工智能 计算与语言 机器学习

摘要

如果让一个人描述一张图像,他可能会用上千种不同的方式。传统上,图像描述模型被训练来生成单一的“最佳”(最接近参考的)图像描述。遗憾的是,这样做会促使生成“信息贫乏”的描述,只关注可能细节的一个子集,而忽略场景中其他潜在有用的信息。在这项工作中,我们引入了一种简单却新颖的方法:“基于委员会共识的图像描述生成”(IC3),旨在生成一条能够捕捉多个标注者视角下高层细节的单一描述。人类评价 IC3 生成的描述至少有三分之二的时间与基线 SOTA 模型一样有帮助,并且 IC3 能将 SOTA 自动召回系统的性能提升高达 84%,优于单个人类生成的参考描述,表明在视觉描述方面相较 SOTA 方法有明显改进。代码见 https://davidmchan.github.io/caption-by-committee/

关键词

引用

@article{arxiv.2302.01328,
  title  = {IC3: Image Captioning by Committee Consensus},
  author = {David M. Chan and Austin Myers and Sudheendra Vijayanarasimhan and David A. Ross and John Canny},
  journal= {arXiv preprint arXiv:2302.01328},
  year   = {2023}
}

备注

To Appear at EMNLP 2023