利用扩散模型揭露文本-图像不一致性
计算机视觉与模式识别
2024-04-30 v1
摘要
在与广泛传播的在线虚假信息的斗争中,一个日益严重的问题是文本-图像不一致,即图像被误导性地与具有不同意图或含义的文本配对。现有的基于分类的文本-图像不一致方法可以识别上下文不一致,但无法提供人类可理解的、可解释的决策理由。尽管更细致,但人工评估在规模上不切实际且容易出错。为了解决这些局限性,本研究引入了D-TIIL(基于扩散的文本-图像不一致定位),它利用文本到图像扩散模型来定位文本和图像对中的语义不一致。这些模型在大规模数据集上训练,充当“全知”代理,过滤掉不相关信息并融入背景知识以识别不一致。此外,D-TIIL使用文本嵌入和修改后的图像区域来可视化这些不一致。为了评估D-TIIL的有效性,我们引入了一个新的TIIL数据集,包含14K个一致和不一致的文本-图像对。与现有数据集不同,TIIL能够在单个单词和图像区域级别进行评估,并精心设计以代表各种不一致。D-TIIL提供了一种可扩展且基于证据的方法来识别和定位文本-图像不一致,为未来打击虚假信息的研究提供了稳健的框架。
引用
@article{arxiv.2404.18033,
title = {Exposing Text-Image Inconsistency Using Diffusion Models},
author = {Mingzhen Huang and Shan Jia and Zhou Zhou and Yan Ju and Jialing Cai and Siwei Lyu},
journal= {arXiv preprint arXiv:2404.18033},
year = {2024}
}