EventLens:利用事件感知预训练和跨模态链接增强视觉常识推理
计算机视觉与模式识别
2024-04-23 v1 计算与语言
摘要
视觉常识推理(VCR)是一项认知任务,挑战模型回答需要人类常识的视觉问题,并提供解释答案正确性的理由。随着大型语言模型(LLMs)的出现,探索它们在VCR中的适用性既自然又必要。然而,VCR任务需要更多外部知识来应对其具有挑战性的问题,需要特殊设计来激活LLMs的常识推理能力。此外,大多数现有的多模态LLMs采用了整个输入图像的抽象表示,这使得难以理解VCR中图像区域和文本之间独特的共指标签,给细粒度对齐带来了挑战。为了解决这些问题,我们提出了EventLens,它利用事件感知预训练和跨模态链接来增强VCR。首先,通过模拟人类推理的认知过程,引入事件感知预训练辅助任务,以更好地激活LLM对复杂场景的整体理解。其次,在微调期间,我们进一步利用参考标签将RoI特征与文本桥接,同时保留两种模态的语义。最后,我们使用指令式提示来缩小预训练和微调之间的差距,并使用任务特定适配器更好地将LLM的固有知识与新的常识整合。实验结果表明了我们提出的辅助任务和细粒度链接策略的有效性。
引用
@article{arxiv.2404.13847,
title = {EventLens: Leveraging Event-Aware Pretraining and Cross-modal Linking Enhances Visual Commonsense Reasoning},
author = {Mingjie Ma and Zhihuan Yu and Yichao Ma and Guohui Li},
journal= {arXiv preprint arXiv:2404.13847},
year = {2024}
}