中文

基础模型能否逐步观看、讲解并指导你制作蛋糕?

人工智能 2023-11-03 v1 人机交互

摘要

尽管 AI 取得了巨大进展,开发能够提供情境化、个性化指导并协助人类完成各类任务的交互式任务指导系统仍是一项重大挑战。这些系统需要对用户和环境有细致理解,并及时准确地决策何时以及说什么。为解决此问题,我们基于人类用户与人类指导者之间的自然交互,创建了一个新的多模态基准数据集 Watch, Talk and Guide(WTaG)。我们进一步提出了两项任务:用户与环境理解,以及指导者决策制定。我们利用多个基础模型研究这些模型在多大程度上可快速适配到感知赋能的任务指导中。我们的定量、定性及人工评估结果表明,这些模型在某些情况下无需任务特定训练即可展现出尚可的性能,但快速而可靠的适配仍是一项重大挑战。我们的基准与基线将为未来情境化任务指导工作提供垫脚石。

关键词

引用

@article{arxiv.2311.00738,
  title  = {Can Foundation Models Watch, Talk and Guide You Step by Step to Make a Cake?},
  author = {Yuwei Bao and Keunwoo Peter Yu and Yichi Zhang and Shane Storks and Itamar Bar-Yossef and Alexander De La Iglesia and Megan Su and Xiao Lin Zheng and Joyce Chai},
  journal= {arXiv preprint arXiv:2311.00738},
  year   = {2023}
}

备注

Accepted to EMNLP 2023 Findings