中文

从多样化视频演示中生成程序

计算机视觉与模式识别 2023-02-02 v1 计算与语言 机器学习

摘要

运用归纳推理从多次观察中提取通用规则的能力是智力的关键指标。作为人类,我们利用这一能力不仅解释周遭世界,也预测我们所经历的各种交互的结果。对多次观察进行泛化历来是机器难以掌握的任务,尤其在需要计算机视觉时。在本文中,我们提出一种模型,可通过同时执行摘要与翻译从视频演示中提取通用规则。我们的方法不同于先前工作,将问题构建为多序列到序列任务,其中摘要由模型学习得到。这使得我们的模型能够利用那些会被传统摘要技术抑制或丢弃的边界情形。此外,我们展示了我们的方法可在无需额外滤波方法的情况下处理含噪规格说明。我们通过在Vizdoom环境中从视频演示合成程序来评估模型,取得了最先进(SOTA)结果,相较先前工作相对提升11.75%的程序准确率。

关键词

引用

@article{arxiv.2302.00178,
  title  = {Program Generation from Diverse Video Demonstrations},
  author = {Anthony Manchin and Jamie Sherrah and Qi Wu and Anton van den Hengel},
  journal= {arXiv preprint arXiv:2302.00178},
  year   = {2023}
}