中文

基于多媒体接地非顺序图脚本归纳

计算与语言 2023-05-30 v1 多媒体

摘要

WikiHow 等在线资源汇编了用于执行日常任务的广泛脚本,可辅助模型学习对过程进行推理。然而,这些脚本总是以线性方式呈现,并未反映人们在现实执行任务时所展现的灵活性。例如,在 CrossTask 数据集中,64.5% 的连续步骤对也以逆序出现,表明其顺序并不固定。此外,每个步骤平均有 2.56 个频繁下一步,表现出“分支”。本文提出非顺序图脚本归纳这一新挑战性任务,旨在捕获过程规划中的可选与可互换步骤。为自动化对给定任务归纳此类图脚本,我们提出利用执行任务的人的松散对齐视频。具体而言,我们设计了一个多模态框架,将过程视频接地到 WikiHow 文本步骤,从而将每个视频转换为潜在真实图脚本上的一条观测步骤路径。这一关键转换使我们能够训练一个脚本知识模型,该模型既能为已学任务生成显式图脚本,也能在给定部分步骤序列时预测未来步骤。我们的最佳模型在下一步预测的 F1@3 上比最强的纯文本/视觉基线绝对提升 17.52%,在部分序列完成的 Acc@1 上绝对提升 13.8%。人工评估显示,我们的模型在捕获顺序与非顺序步骤关系上比 WikiHow 线性基线绝对提升 48.76%。

关键词

引用

@article{arxiv.2305.17542,
  title  = {Non-Sequential Graph Script Induction via Multimedia Grounding},
  author = {Yu Zhou and Sha Li and Manling Li and Xudong Lin and Shih-Fu Chang and Mohit Bansal and Heng Ji},
  journal= {arXiv preprint arXiv:2305.17542},
  year   = {2023}
}