GenEARL:面向多模态事件论元角色标注的无训练生成式框架
计算机视觉与模式识别
2024-04-09 v1 人工智能
摘要
多模态事件论元角色标注(EARL)是一项为图像中每个事件参与者(物体)分配角色的任务,是一个复杂的挑战。它需要对整幅图像、所描绘的事件以及参与该事件的各种物体之间的交互进行推理。现有模型严重依赖高质量的事件标注训练数据来理解事件语义与结构,且无法泛化到新的事件类型与领域。在本文中,我们提出了 GenEARL,一个无训练的生成式框架,利用现代生成模型的能力来理解给定图像上下文下的事件任务描述,以执行 EARL 任务。具体而言,GenEARL 包含两个阶段的生成式提示,使用冻结的视觉语言模型(VLM)与冻结的大语言模型(LLM)。首先,生成式 VLM 学习事件论元角色的语义,并基于图像生成以事件为中心的物体描述。随后,使用预定义的 EARL 模板提示 LLM(即为一个物体分配一个事件论元角色)。我们表明,在 M2E2 与 SwiG 数据集上的零样本 EARL 任务中,GenEARL 的准确率分别比对比预训练(CLIP)基线高出 9.4% 和 14.2%。此外,我们在 M2E2 数据集上的精确率比 CLIP-Event 高出 22%。该框架还允许灵活适应并泛化到未见领域。
引用
@article{arxiv.2404.04763,
title = {GenEARL: A Training-Free Generative Framework for Multimodal Event Argument Role Labeling},
author = {Hritik Bansal and Po-Nien Kung and P. Jeffrey Brantingham and Kai-Wei Chang and Nanyun Peng},
journal= {arXiv preprint arXiv:2404.04763},
year = {2024}
}
备注
20 pages, 15 Figures, 13 figures