中文

VL-CheckList:以对象、属性与关系评估预训练视觉-语言模型

计算机视觉与模式识别 2023-06-23 v2 计算与语言 机器学习

摘要

视觉-语言预训练(VLP)模型近来已成功促进了许多跨模态下游任务。多数现有工作通过比较微调后的下游任务性能来评估其系统。然而,仅有的平均下游任务准确率几乎无法提供每种 VLP 方法的优劣信息,更无从为社区未来如何改进系统提供见解。受用于测试自然语言处理的 CheckList 启发,我们提出了 VL-CheckList,一种理解 VLP 模型能力的新框架。所提方法将 VLP 模型的图像-文本能力划分为三类:对象、属性与关系,并使用一种新颖的分类法进一步细分这三个方面。我们通过所提框架对七个近期流行的 VLP 模型进行了全面研究。结果通过揭示仅从下游任务评估中不可见的被比较模型间的细粒度差异,证实了所提方法的有效性。进一步结果显示了构建更好 VLP 模型的有前景的研究方向。我们的数据与代码可见于:https://github.com/om-ai-lab/VL-CheckList。

关键词

引用

@article{arxiv.2207.00221,
  title  = {VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations},
  author = {Tiancheng Zhao and Tianqi Zhang and Mingwei Zhu and Haozhan Shen and Kyusong Lee and Xiaopeng Lu and Jianwei Yin},
  journal= {arXiv preprint arXiv:2207.00221},
  year   = {2023}
}

备注

9 pages, preprint