基于对比语义相似度学习与内在自编码器的图像描述生成评价
计算机视觉与模式识别
2021-06-30 v1
摘要
自动评价图像描述的质量极具挑战性,因为人类语言十分灵活,同一含义可有多种表达。当前大多数描述评价指标依赖于候选描述与真实标注句子之间的词级匹配,通常忽略了句子级信息。受自编码器机制与对比表示学习进展的启发,我们提出了一种基于学习的图像描述评价指标,称为内在图像描述评价(Intrinsic Image Captioning Evaluation, )。我们设计了三种渐进式模型结构来学习句子级表示——单分支模型、双分支模型与三分支模型。实证测试表明,采用双分支结构训练的 与人工判断的一致性优于现有图像描述评价指标。此外,我们选取若干最先进的图像描述模型,在 MS COCO 数据集上基于现有指标与所提 测试其性能。实验结果显示,我们的方法能与其他现有指标生成的分数良好对齐。就此而言,所提指标可作为描述间内在信息的全新指示量,对现有指标或有补充作用。
引用
@article{arxiv.2106.15312,
title = {Contrastive Semantic Similarity Learning for Image Captioning Evaluation with Intrinsic Auto-encoder},
author = {Chao Zeng and Tiesong Zhao and Sam Kwong},
journal= {arXiv preprint arXiv:2106.15312},
year = {2021}
}