面向视觉常识模型的局部化符号知识蒸馏
人工智能
2023-12-13 v2 计算与语言
计算机视觉与模式识别
摘要
遵循指令的视觉-语言(VL)模型提供了一个灵活的接口,能以零样本方式支持广泛的多模态任务。然而,在全图上操作的接口并不能直接让用户“指向”并访问图像内的特定区域。这种能力不仅对于支持基于参考的VL基准测试很重要,而且对于需要精确图像内推理的实际应用也很重要。我们构建了局部化视觉常识模型,允许用户指定(多个)区域作为输入。我们通过从大型语言模型(LLM)中采样局部化常识知识来训练我们的模型:具体来说,我们提示一个LLM,根据由一组VL模型自动生成的全局文字图像描述和局部文字区域描述来收集常识知识。借助一个单独训练的、能筛选高质量示例的评论家模型,我们发现,在局部化常识语料库上进行训练可以成功蒸馏现有的VL模型,以支持将参考作为输入的接口。零样本设置下的实证结果和人类评估表明,与将生成的指代表达传递给LLM的基线方法相比,我们的蒸馏方法能产生更精确的推理型VL模型。
引用
@article{arxiv.2312.04837,
title = {Localized Symbolic Knowledge Distillation for Visual Commonsense Models},
author = {Jae Sung Park and Jack Hessel and Khyathi Raghavi Chandu and Paul Pu Liang and Ximing Lu and Peter West and Youngjae Yu and Qiuyuan Huang and Jianfeng Gao and Ali Farhadi and Yejin Choi},
journal= {arXiv preprint arXiv:2312.04837},
year = {2023}
}
备注
Neurips 2023