ViLPAct:面向多模态人类活动的组合泛化基准
计算机视觉与模式识别
2023-03-10 v4 计算与语言
摘要
我们引入了 ViLPAct,一个用于人类活动规划的新型视觉-语言基准。它专为这样一个任务而设计:具身 AI 智能体能够根据有关人类初始活动的视频片段和文本中的意图,推理并预测人类的未来动作。该数据集包含来自 \charades 的 2.9k 个视频,通过众包扩展了意图,以及一个多选题测试集和四个强基线。其中一个基线实现了一种基于多模态知识库 (MKB) 的神经符号方法,而其他基线则是改编自最新 SOTA 方法的深度生成模型。根据我们的大量实验,关键挑战在于组合泛化以及对两种模态信息的有效利用。
引用
@article{arxiv.2210.05556,
title = {ViLPAct: A Benchmark for Compositional Generalization on Multimodal Human Activities},
author = {Terry Yue Zhuo and Yaqing Liao and Yuecheng Lei and Lizhen Qu and Gerard de Melo and Xiaojun Chang and Yazhou Ren and Zenglin Xu},
journal= {arXiv preprint arXiv:2210.05556},
year = {2023}
}
备注
Accepted at EACL2023 (Findings)