中文

Egoshots:一个自我视觉生活记录数据集及用于评估图像描述模型多样性的语义保真度度量

计算机视觉与模式识别 2020-03-30 v2 机器学习

摘要

图像描述模型已能够生成语法正确且人类可理解的句子。然而,大多数描述传达的信息有限,因为所用模型是在未对日常生活中所有可能存在物体进行描述的数据集上训练的。由于这种先验信息的缺失,大多数描述偏向于场景中仅有的少数物体,从而限制了其在日常生活中的使用。本文中,我们试图展示现有图像描述模型的偏向性,并提出一个新的图像描述数据集Egoshots,包含978张无标注的真实生活图像。我们进一步利用最先进的预训练图像描述和物体识别网络来标注我们的图像,并展示现有工作的局限性。此外,为评估生成描述的质量,我们提出一种新的图像描述度量:基于物体的语义保真度(SF)。现有的图像描述度量只能在存在对应标注时评估描述;而SF允许对无标注图像生成的描述进行评估,使其对真实生活生成的描述非常有用。

关键词

引用

@article{arxiv.2003.11743,
  title  = {Egoshots, an ego-vision life-logging dataset and semantic fidelity metric to evaluate diversity in image captioning models},
  author = {Pranav Agarwal and Alejandro Betancourt and Vana Panagiotou and Natalia Díaz-Rodríguez},
  journal= {arXiv preprint arXiv:2003.11743},
  year   = {2020}
}

备注

15 pages, 25 figures, Accepted at Machine Learning in Real Life (ML-IRL) ICLR 2020 Workshop