基于沟通游戏中出现的自然语言提升图像描述能力无需额外数据
机器学习
2025-07-14 v1 计算机视觉与模式识别
摘要
图像描述是开发各种人工智能系统的重要问题,而这些任务需要大量标注图像来训练模型。由于所有现有的标注数据集都已用于训练大型视觉语言模型(VLM),因此提升相同模型的性能变得具有挑战性。鉴于此,考虑无监督图像描述性能就显得至关重要,而这一领域相对缺乏探索。为此,我们提出了 LoGIC(Lewis Communication Game for Image Captioning,即 Lewis 图像描述通信游戏),这是一种多智能体强化学习游戏。该方法由两个智能体组成,分别为“说话者”和“听者”,目标是学习用于自然语言沟通的策略。我们在合作公共奖励设置下使用 GRPO 算法训练智能体,并表明随着智能体学习游戏策略,图像描述性能会得到提升。我们表明,使用预训练视觉语言模型(VLM)作为“说话者”,使用大型语言模型(LLM)进行语言理解作为“听者”,在使用 LoGIC 进行微调后,我们获得了 46 的 BLEU 分数,净增 2 分,优于 vanilla VLM 的 44 分。此外,我们将“说话者”中的 VLM 替换为轻量组件:(i) 用于图像感知的 ViT 和 (ii) 用于语言生成的 GPT2,从头使用 LoGIC 对其进行训练,在无监督环境下获得 31 的 BLEU 分数,相较于现有无监督图像描述方法提升了 10 分。
引用
@article{arxiv.2507.08610,
title = {Emergent Natural Language with Communication Games for Improving Image Captioning Capabilities without Additional Data},
author = {Parag Dutta and Ambedkar Dukkipati},
journal= {arXiv preprint arXiv:2507.08610},
year = {2025}
}