中文

创建用于序列任务的多模态对齐数据集的方法

计算与语言 2020-05-20 v1

摘要

许多高层程序性任务可分解为顺序各异、工具选择不同的指令序列。在烹饪领域,网络提供了许多部分重叠的文本与视频食谱(即程序),描述如何制作同一道菜(即高层任务)。将同一道菜不同来源的指令对齐,可产生比传统文本指令语义丰富得多的描述性视觉解释,提供关于真实世界程序如何构建的常识性洞察。学习对齐这些不同指令集具有挑战性,因为:a) 不同食谱的指令顺序与食材使用不同;b) 视频指令可能含噪且往往包含比文本指令多得多的信息。为应对这些挑战,我们首先使用一种无监督对齐算法,学习同一道菜不同食谱指令间的两两对齐;随后使用图算法推导同一道菜多个文本与多个视频食谱间的联合对齐。我们发布了Microsoft Research多模态对齐食谱语料库,包含4,262道菜、具有丰富常识信息的150K食谱间两两对齐。

关键词

引用

@article{arxiv.2005.09606,
  title  = {A Recipe for Creating Multimodal Aligned Datasets for Sequential Tasks},
  author = {Angela S. Lin and Sudha Rao and Asli Celikyilmaz and Elnaz Nouri and Chris Brockett and Debadeepta Dey and Bill Dolan},
  journal= {arXiv preprint arXiv:2005.09606},
  year   = {2020}
}

备注

This paper has been accepted to be published at ACL 2020