中文

探索 GPT-4V(ision) 的推荐能力:一项初步案例研究

信息检索 2023-11-08 v1 计算与语言

摘要

大型多模态模型(Large Multimodal Models, LMMs)已在多种视觉与语言任务中展现出令人印象深刻的性能,但其在具视觉辅助的推荐任务中的潜在应用仍未被探索。为弥补这一空白,我们提出一项初步案例研究,考察 OpenAI 近期发布的 LMM——GPT-4V(ision) 的推荐能力。我们构建了一系列跨越多个领域的定性测试样本,并利用这些样本评估 GPT-4V 在推荐场景中的回答质量。在这些测试样本上的评估结果证明,得益于其鲁棒的视觉-文本理解能力与广博的通用知识,GPT-4V 在不同领域具备显著的零样本推荐能力。然而,我们也发现了使用 GPT-4V 进行推荐的一些局限,包括在面对相似输入时倾向于给出相似回答。本报告最后深入讨论了在推荐场景中使用 GPT-4V 所面临的挑战与研究机遇。我们的目标是探索将 LMMs 从视觉与语言任务拓展至推荐任务的可能性。我们希望能启发对下一代多模态生成式推荐模型的进一步研究,这类模型可通过提供更高的多样性与交互性来改善用户体验。本报告中使用的所有图像与提示词将在 https://github.com/PALIN2018/Evaluate_GPT-4V_Rec 公开。

关键词

引用

@article{arxiv.2311.04199,
  title  = {Exploring Recommendation Capabilities of GPT-4V(ision): A Preliminary Case Study},
  author = {Peilin Zhou and Meng Cao and You-Liang Huang and Qichen Ye and Peiyan Zhang and Junling Liu and Yueqi Xie and Yining Hua and Jaeboum Kim},
  journal= {arXiv preprint arXiv:2311.04199},
  year   = {2023}
}

备注

In Progress