揭示并解决统一视觉-语言模型中的跨任务不一致性
计算机视觉与模式识别
2024-02-23 v2 人工智能
计算与语言
机器学习
摘要
随着通用视觉模型在广泛任务上变得日益有效,它们在其支持的任务之间保持一致至关重要。不一致的AI模型被人类用户视为脆弱且不可信,并且更难以整合到依赖其输出的更大系统中。衡量可能包含不同模态输出的异质任务之间的一致性具有挑战性,因为难以确定预测彼此是否一致。作为解决方案,我们引入一个基准数据集CocoCon,其中我们通过以微小但语义有意义的方式修改多个任务的测试实例来创建对比集以改变金标签,并概述通过跨任务对原始与扰动实例排序来衡量模型是否一致的指标。我们发现最先进的视觉-语言模型在跨任务上表现出惊人高度的不一致行为,尤其对于更异质的任务。为缓解此问题,我们提出一种基于秩相关的辅助训练目标,其在大规模自动创建的跨任务对比集上计算,可改善大型统一模型的多任务一致性,同时保持其在下游任务上的原始精度。
引用
@article{arxiv.2303.16133,
title = {Exposing and Addressing Cross-Task Inconsistency in Unified Vision-Language Models},
author = {Adyasha Maharana and Amita Kamath and Christopher Clark and Mohit Bansal and Aniruddha Kembhavi},
journal= {arXiv preprint arXiv:2303.16133},
year = {2024}
}
备注
TMLR 2024; Project Website: https://adymaharana.github.io/cococon/