VILT:面向复杂任务的视频指令链接
信息检索
2022-08-24 v1
摘要
本工作致力于解决开发对话式助手时的挑战,该类助手需支持丰富的多模态视频交互以交互式地完成现实世界任务。我们引入将教学视频自动链接到任务步骤的任务,称为“面向复杂任务的视频指令链接”(VILT)。具体而言,我们聚焦于烹饪领域,并使用支持视频的 Alexa 技能使用户能够交互式烹饪餐食。我们创建了一个可复用基准,包含来自食谱任务的 61 个查询,并策划了 2,133 个教学类“操作指南”烹饪视频集合。利用最先进的检索方法研究 VILT,我们发现使用 ANCE 的稠密检索最为有效,取得了 0.566 的 NDCG@3 和 0.644 的 P@1。我们还进行了一项用户研究,衡量在真实任务场景中融入视频的效果,其中 10 名参与者使用最先进的 Alexa TaskBot 系统在不同多模态实验条件下完成若干烹饪任务。与手动链接视频交互的用户表示他们 64% 的时间学到了新东西,相比自动链接视频(55%)提高了 9%,表明链接视频的相关性对任务学习十分重要。
引用
@article{arxiv.2208.10858,
title = {VILT: Video Instructions Linking for Complex Tasks},
author = {Sophie Fischer and Carlos Gemmell and Iain Mackie and Jeffrey Dalton},
journal= {arXiv preprint arXiv:2208.10858},
year = {2022}
}
备注
7 pages, IMuR Preprint