缓解开放词汇图像描述幻觉
计算机视觉与模式识别
2025-01-27 v4 人工智能
摘要
尽管近年来图像条件文本生成取得了快速进展,但图像描述仍然面临幻觉这一根本问题,即生成无法从给定图像推断出的虚假细节。现有方法主要使用闭集目标列表来缓解或评估图像描述中的幻觉,忽略了实际中出现的幻觉的长尾特性。为此,我们提出了一个在开放词汇设置下解决图像描述幻觉的框架。我们的框架包括一个新的基准测试 OpenCHAIR,它利用生成式基础模型评估图像描述的开放词汇目标幻觉,在多样性和准确性上均超越了流行且规模相近的 CHAIR 基准。此外,为了在不使用闭集目标列表的情况下缓解开放词汇幻觉,我们提出了 MOCHa,一种利用强化学习进展的方法。我们的多目标奖励函数明确针对生成中保真度与充分性之间的权衡,无需任何强监督。MOCHa 改进了多种图像描述模型,这一点可由我们的 OpenCHAIR 基准和其他现有指标所证实。代码和模型可在以下网址找到:https://github.com/assafbk/mocha_code
引用
@article{arxiv.2312.03631,
title = {Mitigating Open-Vocabulary Caption Hallucinations},
author = {Assaf Ben-Kish and Moran Yanuka and Morris Alper and Raja Giryes and Hadar Averbuch-Elor},
journal= {arXiv preprint arXiv:2312.03631},
year = {2025}
}
备注
Website Link: https://assafbk.github.io/mocha/