端到端与神经符号视觉-语言推理系统的泛化差异
计算与语言
2022-10-28 v1 计算机视觉与模式识别
摘要
对于视觉与语言推理任务,全连接主义的端到端方法和混合的神经符号方法都取得了较高的分布内性能。每种范式在哪些分布外设置下表现更优?我们通过四种泛化测试类型在单图像和多图像视觉问答上研究了这个问题:一种新颖的用于多图像查询的片段组合测试、对比集、组合泛化以及跨基准迁移。视觉与语言端到端训练系统在所有这些测试中都表现出相当大的性能下降。神经符号方法在从GQA到VQA的跨基准迁移上表现更差,但在其他泛化测试中显示出较小的准确率下降,并且其性能通过少样本训练迅速提升。总体而言,我们的结果展示了这两种范式的互补优势,并强调了使用多样化的泛化测试套件来全面表征模型对分布偏移的鲁棒性的重要性。
引用
@article{arxiv.2210.15037,
title = {Generalization Differences between End-to-End and Neuro-Symbolic Vision-Language Reasoning Systems},
author = {Wang Zhu and Jesse Thomason and Robin Jia},
journal= {arXiv preprint arXiv:2210.15037},
year = {2022}
}
备注
Accepted by the Findings of EMNLP 2022