基于生成式AI的视觉蕴含数据集构建
计算与语言
2025-08-18 v1
摘要
本文提出并验证了一个用于训练视觉蕴含模型的新合成数据集。现有的视觉蕴含数据集与文本蕴含数据集相比规模较小且稀疏。手动创建数据集劳动密集。我们以文本蕴含的SNLI数据集为基础构建合成数据集。我们将SNLI的前提文本作为生成式图像模型Stable Diffusion的输入提示,为每个文本前提生成一张图像以替代之。我们对数据集进行了内在和外在评估。在外在评估中,我们使用生成的图像作为基于CLIP特征向量的视觉蕴含分类器的训练数据来评估生成图像的有效性。我们发现,与使用真实数据训练相比(F-score为0.703),合成训练数据在SNLI-VE上仅导致轻微的质量下降(F-score为0.686)。我们还将生成训练数据的质量与另一个数据集SICK-VTE上的原始训练数据进行了比较。同样,F-score仅略有下降:从0.400降至0.384。这些结果表明,在数据稀疏的设置下,合成数据是训练视觉蕴含模型的有前景的解决方案。
引用
@article{arxiv.2508.11605,
title = {Dataset Creation for Visual Entailment using Generative AI},
author = {Rob Reijtenbach and Suzan Verberne and Gijs Wijnholds},
journal= {arXiv preprint arXiv:2508.11605},
year = {2025}
}
备注
NALOMA: Natural Logic meets Machine Learning workshop @ ESSLLI 2025