视频对话:关于时空中的对象的对话
计算机视觉与模式识别
2022-07-11 v1 机器学习
摘要
如果能够创建一个能就人类所观看的内容与之进行有意义对话的系统,这将是一项技术壮举。朝向该目标的一种设定被提出作为视频对话任务,其中系统被要求针对正在进行对话中的问题生成自然语句。该任务带来了巨大的视觉、语言和推理挑战,若没有支持高层推理的恰当视频与对话表示方案,便难以轻易克服。为应对这些挑战,我们提出了一种用于视频对话的以对象为中心的新框架,支持神经推理,称为 COST——即 Conversation about Objects in Space-Time(关于时空中的对象的对话)的缩写。此处视频中的动态时空视觉内容首先被解析为对象轨迹。给定该视频抽象,COST 维护并跟踪与对象关联的对话状态,这些状态在接收到新问题时更新。针对每个问题动态且条件性地推断对象间的交互,这些交互作为它们之间关系推理的基础。COST 还维护先前答案的历史,这使得能够检索相关的以对象为中心的信息来丰富答案生成过程。随后语言生成以逐步方式进行,考虑当前语句、现有对话和当前问题的上下文。我们在 DSTC7 和 DSTC8 基准上评估 COST,展示了其相对于最先进方法的竞争力。
引用
@article{arxiv.2207.03656,
title = {Video Dialog as Conversation about Objects Living in Space-Time},
author = {Hoang-Anh Pham and Thao Minh Le and Vuong Le and Tu Minh Phuong and Truyen Tran},
journal= {arXiv preprint arXiv:2207.03656},
year = {2022}
}
备注
Accepted to ECCV 2022, code will be available at https://github.com/hoanganhpham1006/COST