为何关系图将拯救下一代视觉基础模型?
计算机视觉与模式识别
2025-08-27 v1
摘要
视觉基础模型(FMs)已成为计算机视觉中 predominant 的架构,提供了从大规模多模态语料中学习的高度可迁移表示。然而,它们在需要对实体、角色以及时空关系进行显式推理的任务上仍存在持久的局限性。此类关系能力对细粒度的人类活动识别、镜像视频理解以及多模态医学图像分析至关重要,后者中空间、时间和语义依赖关系对性能至关重要。我们认为,下一代FMs应包含显式的关系接口,具体表现为动态关系图(其拓扑结构和边缘语义从输入和任务上下文中推断)。我们通过近期系统在人类操作动作识别和脑肿瘤分割中的跨域证据,说明了增强FMs的轻量级、上下文自适应图形推理模块可显著提升细粒度语义忠诚度、跨分布鲁棒性、可解释性和计算效率,而相较于仅使用FMs的基线方法。重要的是,通过对语义节点进行稀疏推理,这类混合模型还能在内存和硬件效率方面取得优势,使其能在实际资源限制下部署。我们总结了针对FM图混合模型的面向目标的研究议程,优先考虑学习的动态图构建、多层次关系推理(例如在活动理解中对部件-对象-场景,或在医学影像中对区域-器官)、跨模态融合以及直接探测结构化视觉任务中关系能力的评估协议。
引用
@article{arxiv.2508.18421,
title = {Why Relational Graphs Will Save the Next Generation of Vision Foundation Models?},
author = {Fatemeh Ziaeetabar},
journal= {arXiv preprint arXiv:2508.18421},
year = {2025}
}