O3SLM:开放权重、开放数据与开放词汇素描-语言模型
计算机视觉与模式识别
2025-12-25 v2 计算与语言
机器学习
摘要
尽管大型视觉语言模型(LVLMs)在实际应用中日益受到部署,但其理解抽象视觉输入的能力仍有限。具体而言,它们难以理解手绘素描,这种模态提供了一种直观的表达方式,对于难以用文本描述的概念尤为重要。我们识别出主要瓶颈是缺乏大规模数据集,能够联合建模素描、写实图像以及相应的自然语言指令。为此,我们提出了两个关键贡献:(1)一个新的大规模数据集,包含图像-素描-指令三元组,旨在促进预训练和指令调优;(2)在此数据集上训练的O3SLM模型。对多个基于素描的任务进行全面评估:(a)目标定位,(b)计数,(c)图像检索即(SBIR和细粒度SBIR),和(d)视觉问答(VQA);同时结合三个现有素描数据集QuickDraw!、Sketchy和Tu Berlin,以及我们生成的SketchVCL数据集,结果显示O3SLM在素描理解和推理方面实现了最佳性能,显著优于现有的LVLMs。
引用
@article{arxiv.2511.14368,
title = {O3SLM: Open Weight, Open Data, and Open Vocabulary Sketch-Language Model},
author = {Rishi Gupta and Mukilan Karuppasamy and Shyam Marjit and Aditay Tripathi and Anirban Chakraborty},
journal= {arXiv preprint arXiv:2511.14368},
year = {2025}
}
备注
Accepted to AAAI 2026