中文

通过视频域中的因果动作-效应建模进行隐式可供性获取

计算与语言 2023-12-19 v1 人工智能

摘要

可供性知识是常识知识的基本方面。近期发现表明,世界知识通过大规模自监督预训练涌现,这激励我们探索从视觉领域获取可供性知识。为此,我们扩充了现有的教学视频资源,创建了新的因果动作-效应(CAE)数据集,并设计了两个新颖的预训练任务——掩码动作建模(MAM)和掩码效应建模(MEM)——分别促进模型中两种可供性属性的获取:行为等价性和实体等价性。我们通过实验证明了所提方法在学习可供性属性方面的有效性。此外,我们表明,在零样本物理推理探测任务上,经过两个任务预训练的模型优于强大的基于图像的视觉-语言基础模型(FLAVA)以及纯语言模型。

关键词

引用

@article{arxiv.2312.11345,
  title  = {Implicit Affordance Acquisition via Causal Action-Effect Modeling in the Video Domain},
  author = {Hsiu-Yu Yang and Carina Silberer},
  journal= {arXiv preprint arXiv:2312.11345},
  year   = {2023}
}

备注

Accepted at IJCNLP-AACL 2023