通过情感与语义分析评估图像标题的真实性与质量
计算机视觉与模式识别
2024-09-17 v1 人工智能
机器学习
摘要
深度学习的发展高度依赖大量标记数据用于自然语言处理和计算机视觉任务。特别是在图像到文本或图像到图像的管道中,人类生成的图像标题可能不慎被模型学习到意见(情感)。此外,学习也可能受提供标题的多样性和多样性的影响。尽管大规模数据集的标注主要依赖众包或数据工作者池,但评估此类训练数据的质量至关重要。本研究提出一种聚焦于情感与语义丰富性的评估方法。该方法应用于COCO-MS数据集,该数据集包含约15万张带有分段目标对象及其众包标题的图像。我们采用预训练模型(Twitter-RoBERTa-base和BERT-base)从标题中提取情感分数和语义嵌入的变异性。通过多元线性回归检验情感分数与语义变异性与目标类别之间的关系。结果表明,尽管大多数标题为中性,但约6%的标题表现出强烈情感,受特定目标类别影响。同一图像内标题的语义变异性保持较低且与目标类别不相关。模型生成的标题中,少于1.5%的标题表现出强烈情感,未受目标类别影响,且不与相应的人类生成标题情感相关。该研究展示了一种以图像内容为依据评估众包或工作者来源标题质量的方法。
关键词
引用
@article{arxiv.2409.09560,
title = {Evaluating authenticity and quality of image captions via sentiment and semantic analyses},
author = {Aleksei Krotov and Alison Tebo and Dylan K. Picart and Aaron Dean Algave},
journal= {arXiv preprint arXiv:2409.09560},
year = {2024}
}