合成视觉基因
计算机视觉与模式识别
2025-06-10 v1
摘要
对视觉关系(如空间、功能、交互、社会等)进行推理被认为是人类认知的基本组成部分。尽管多模态语言模型(MLMs)在视觉理解方面取得了重大进展,但对关系的精确推理及其生成仍是一个挑战。我们引入ROBIN:一个在视觉关系上进行密集注释并能构建高质量稠密场景图的MLM指令微调模型。为训练ROBIN,我们策划了SVG:一个通过从现有场景图中选中对象缺失的关系并使用教师MLM和精心设计的过滤过程来完成缺失关系的合成场景图数据集。为为任何图像生成更准确和丰富的场景图,我们引入SG-EDIT:一个自蒸馏框架,GPT-4o进一步细化ROBIN预测的场景图,通过删除不太可能的关系和/或建议相关关系。总体而言,我们的数据集包含146K张图像和560万个关系,涵盖260万个对象。结果表明,尽管ROBIN-3B模型是在少于300万个实例上训练,却超过了在3000万个实例上训练的相似规模模型在关系理解基准测试中表现更好,甚至超过了最高可达13B参数的更大模型。值得注意的是,它在指代表达理解中实现了88.9的分数,超越了之前的最佳87.4。我们的结果表明,针对精炼后的场景图数据进行训练对于保持跨 diverse 视觉推理任务中的高性能至关重要。
引用
@article{arxiv.2506.07643,
title = {Synthetic Visual Genome},
author = {Jae Sung Park and Zixian Ma and Linjie Li and Chenhao Zheng and Cheng-Yu Hsieh and Ximing Lu and Khyathi Chandu and Quan Kong and Norimasa Kobori and Ali Farhadi and Yejin Choi and Ranjay Krishna},
journal= {arXiv preprint arXiv:2506.07643},
year = {2025}
}
备注
CVPR 2025