中文

ICC:量化图像描述具体性以进行多模态数据集筛选

机器学习 2025-08-13 v4 计算机视觉与模式识别

摘要

在配对文本-图像数据上的大规模训练正日益成为多模态学习的核心,但受到现实世界数据集高度噪声特性的挑战。标准数据过滤方法能够成功移除不匹配的文本-图像对,但允许语义相关但高度抽象或主观的文本。这些方法缺乏细粒度能力来分离最具体的样本,这些样本为噪声数据集中的学习提供了最强信号。在这项工作中,我们提出了一个新的度量标准——图像描述具体性(ICC),它在没有图像参考的情况下评估描述文本,以衡量其具体性和在多模态学习中的相关性。我们的方法利用强大的基础模型来测量多模态表示中的视觉-语义信息损失。我们证明,这与单词语句层面具体性的人工评估高度相关。此外,我们表明使用ICC进行筛选补充了现有方法:它成功地从多模态大规模数据集中选择最高质量的样本,从而在资源受限的环境中实现高效训练。

关键词

引用

@article{arxiv.2403.01306,
  title  = {ICC: Quantifying Image Caption Concreteness for Multimodal Dataset Curation},
  author = {Moran Yanuka and Morris Alper and Hadar Averbuch-Elor and Raja Giryes},
  journal= {arXiv preprint arXiv:2403.01306},
  year   = {2025}
}

备注

Accepted to ACL 2024 (Finding). For Project webpage, see https://moranyanuka.github.io/icc/