中文

言所未见:通过对话智能体描述视频

计算机视觉与模式识别 2021-06-29 v1

摘要

当前的视觉与语言任务通常将完整的视觉数据(例如原始图像或视频)作为输入,然而实际场景常包含由于各种原因(如固定摄像机的受限视野或因安全考虑而有意遮挡视觉)导致部分视觉信息不可访问的情况。作为迈向更实际应用场景的一步,我们引入一项新任务,旨在给定不完整视觉数据时,利用两个智能体间的自然语言对话作为补充信息源来描述视频。与大多数现有视觉-语言任务中 AI 系统可完全访问图像或视频片段(可能泄露可识别的人脸或声音等敏感信息)不同,我们有意限制 AI 系统的视觉输入,并寻求一种更安全、透明的信息媒介,即自然语言对话,来补充缺失的视觉信息。具体而言,其中一个智能体——Q-BOT——被给定视频开头和结尾的两帧语义分割图像,以及在描述未见视频前可提问相关自然语言问题的有限次数。另一智能体 A-BOT 可访问完整视频,通过回答所提问题协助 Q-BOT 达成目标。我们引入两种不同实验设置,其内部对话生成过程分别为生成式(即智能体自由生成问题与回答)或判别式(即智能体从候选中选择问题与回答)。借助所提出的统一 QA 协作网络,我们通过实验展示了两个对话智能体间的知识迁移过程,以及使用自然语言对话作为不完整隐式视觉补充的有效性。

关键词

引用

@article{arxiv.2106.14069,
  title  = {Saying the Unseen: Video Descriptions via Dialog Agents},
  author = {Ye Zhu and Yu Wu and Yi Yang and Yan Yan},
  journal= {arXiv preprint arXiv:2106.14069},
  year   = {2021}
}

备注

Accepted as a regular paper at TPAMI 2021