中文

SocialGPT:通过贪心分段优化提示大语言模型进行社会关系推理

计算机视觉与模式识别 2024-10-30 v1

摘要

社会关系推理旨在从图像中识别朋友、配偶、同事等关系类别。当前方法采用端到端训练专用网络并使用标注图像数据的范式,但在泛化性和可解释性方面存在局限。为解决这些问题,我们首先提出一个简洁而精心设计的框架 SocialGPT,该框架在模块化架构中结合了视觉基础模型(VFM)的感知能力和大语言模型(LLM)的推理能力,为社会关系识别提供了强大的基线。具体而言,我们指示 VFM 将图像内容转化为文本形式的社会故事,然后利用 LLM 进行基于文本的推理。SocialGPT 引入了系统性的设计原则,以分别适配 VFM 和 LLM 并弥合它们之间的差距。无需额外的模型训练,该方法在两个数据库上取得了有竞争力的零样本结果,同时提供了可解释的答案,因为 LLM 能够为其决策生成基于语言的解释。在推理阶段为 LLM 手动设计提示的过程繁琐,因此需要一种自动化的提示优化方法。由于我们本质上是将视觉分类任务转化为 LLM 的生成任务,自动提示优化遇到了独特的长提示优化问题。为解决此问题,我们进一步提出了贪婪分段提示优化(GSPO),该方法利用分段级别的梯度信息进行贪婪搜索。实验结果表明,GSPO 显著提升了性能,并且我们的方法还能泛化到不同的图像风格。代码可在 https://github.com/Mengzibin/SocialGPT 获取。

关键词

引用

@article{arxiv.2410.21411,
  title  = {SocialGPT: Prompting LLMs for Social Relation Reasoning via Greedy Segment Optimization},
  author = {Wanhua Li and Zibin Meng and Jiawei Zhou and Donglai Wei and Chuang Gan and Hanspeter Pfister},
  journal= {arXiv preprint arXiv:2410.21411},
  year   = {2024}
}

备注

Accepted by NeurIPS 2024. Project page: https://mengzibin.github.io/SocialGPT.github.io/