多模态关系知识图像上的结构化与抽象推理
计算机视觉与模式识别
2026-04-30 v2 计算与语言
摘要
从视觉模态中理解和推理抽象信息对当前的多模态大语言模型(MLLMs)构成了重大挑战。在各种形式的抽象信息中,多模态关系知识(MMRK)——它使用节点-边格式表示多模态实体之间的抽象关系结构——在很大程度上仍未得到充分探索。特别是,对此类数据的结构化与抽象推理(STAR)很少受到研究界的关注。为了弥合大规模高质量数据和能力增强方法论方面的双重差距,本文做出了以下关键贡献:(i)一个自动化的STAR数据引擎,能够合成带有MMRK的图像,为各种STAR任务构建具有可靠思维链的多模态指令数据;(ii)一个全面的两阶段能力增强训练框架,以及一套针对不同STAR任务定制的评估协议。基于这些贡献,我们引入了STAR-64K,一个包含64K高质量多模态指令样本的数据集,并在5个开源MLLMs上进行了实验。实验结果表明,我们的两阶段增强框架使较小的3B/7B模型在STAR任务上显著优于GPT-4o。此外,我们针对各种设计的有效性、数据可迁移性和可扩展性提供了深入分析。
引用
@article{arxiv.2510.21828,
title = {Structured and Abstractive Reasoning on Multi-modal Relational Knowledge Images},
author = {Yichi Zhang and Zhuo Chen and Lingbing Guo and Wen Zhang and Huajun Chen},
journal= {arXiv preprint arXiv:2510.21828},
year = {2026}
}
备注
Accepted by Findings of ACL 2026