中文

基于视觉语言模型并利用视觉上下文提取的标题评估方法

计算机视觉与模式识别 2024-02-29 v1 人工智能

摘要

鉴于视觉和语言建模的加速进展,对机器生成的图像标题的准确评估仍然至关重要。为了更接近人类偏好来评估标题,指标需要区分不同质量和内容的标题。然而,传统指标在比较单词的浅层匹配或嵌入相似性方面存在不足,因此仍需改进。本文提出了VisCE2^2,一种基于视觉语言模型的标题评估方法。我们的方法聚焦于视觉上下文,即图像的详细内容,包括对象、属性和关系。通过将视觉上下文提取并组织成结构化格式,我们用视觉上下文替代人工编写的参考,帮助视觉语言模型更好地理解图像,从而提升评估性能。通过在多个数据集上的元评估,我们验证了VisCE2^2在捕获标题质量方面优于传统预训练指标,并且与人类判断具有更优的一致性。

关键词

引用

@article{arxiv.2402.17969,
  title  = {Vision Language Model-based Caption Evaluation Method Leveraging Visual Context Extraction},
  author = {Koki Maeda and Shuhei Kurita and Taiki Miyanishi and Naoaki Okazaki},
  journal= {arXiv preprint arXiv:2402.17969},
  year   = {2024}
}