大语言模型也能分享图像!
计算机视觉与模式识别
2024-07-08 v2 人工智能
计算与语言
摘要
本文探讨了大语言模型(LLMs,如 GPT-4 和 LLaMA 2)在零样本设定下的图像分享能力。为促进对 LLMs 的全面评估,我们引入了 PhotoChat++ 数据集,其包含丰富的标注(即意图、触发句、图像描述和显著信息)。此外,我们提出了无梯度且可扩展的 Decide, Describe, and Retrieve(DribeR)框架。通过大量实验,我们释放了配备 LLMs 的 DribeR 在零样本提示中的图像分享能力,其中 ChatGPT 取得了最佳性能。我们的发现还揭示了 LLMs 在零样本条件下的涌现图像分享能力,验证了 DribeR 的有效性。我们使用该框架展示了其在两个真实场景中的实用性与有效性:(1)人机交互和(2)数据集增强。据我们所知,这是首项在零样本设定下评估多种 LLMs 图像分享能力的研究。我们将源代码和数据集公开于 https://github.com/passing2961/DribeR。
引用
@article{arxiv.2310.14804,
title = {Large Language Models can Share Images, Too!},
author = {Young-Jun Lee and Dokyong Lee and Joo Won Sung and Jonghwan Hyeon and Ho-Jin Choi},
journal= {arXiv preprint arXiv:2310.14804},
year = {2024}
}
备注
ACL 2024 Findings; Code is available in https://github.com/passing2961/DribeR