ReGraP-LLaVA:具备推理能力的基于图的个性化大语言与视觉助手
计算机视觉与模式识别
2025-05-20 v2 人工智能
摘要
个性化多模态大语言模型(MLLM)的最新进展能有效捕捉用户特定概念,支持个性化概念的识别和上下文描述。然而,人类通常会探索和推理物体与个体之间的关系,超越表层信息以实现更个性化和上下文化的理解。为此,现有方法可能面临三个主要局限:其训练数据缺乏可学习物体间关系的多物体集合。基于有限的训练数据,它们的模型忽略了不同个性化概念之间的关系,且无法对其进行推理。其实验主要集中于单一个性化概念,评估也仅限于识别和描述任务。为解决这些局限,我们提出了一个名为 ReGraP 的新数据集,包含 120 组个性化知识。每组包含图像、知识图谱(KG)以及从知识图谱派生的思维链(CoT)问答对,从而支持更结构化、更复杂的推理路径。我们提出了 ReGraP-LLaVA,一个使用相应知识图谱和思维链问答对训练的 MLLM,其中设计了软图和硬图提示方法,以在模型的语义空间中对齐知识图谱。我们建立了 ReGraP 基准,该基准包含多样化的任务类型:在开放式和封闭式设置下的选择题、填空题、判断题和描述性问题。所提出的基准旨在评估个性化 MLLM 的关系推理和知识连接能力。我们在提出的 ReGraP-LLaVA 和其他有竞争力的 MLLM 上进行了实验。结果表明,所提出的模型不仅学习了个性化知识,还在响应中执行了关系推理,与竞争方法相比达到了最先进的性能。所有代码和数据集均已发布在:https://github.com/xyfyyds/ReGraP。
引用
@article{arxiv.2505.03654,
title = {ReGraP-LLaVA: Reasoning enabled Graph-based Personalized Large Language and Vision Assistant},
author = {Yifan Xiang and Zhenxi Zhang and Bin Li and Yixuan Weng and Shoujun Zhou and Yangfan He and Keqin Li},
journal= {arXiv preprint arXiv:2505.03654},
year = {2025}
}
备注
Work in progress