iCap:基于预测文本的交互式图像描述生成
人机交互
2020-02-25 v3 计算机视觉与模式识别
摘要
本文研究了一个全新的主题:带人在回路的交互式图像描述生成。与自动化图像描述生成在推理阶段仅以给定测试图像为唯一输入不同,在交互式场景中我们可同时获取测试图像和一系列(不完整的)用户输入句子。我们将该问题形式化为视觉条件句子补全 (VCSC)。针对 VCSC,我们提出了用于图像描述补全的异步双向解码 (ABD-Cap)。以 ABD-Cap 为核心模块,我们构建了 iCap,一个基于网页的交互式图像描述系统,能够针对用户的实时输入预测新文本。一系列涵盖自动化评估和真实用户研究的实验表明了我们所提方法的可行性。
引用
@article{arxiv.2001.11782,
title = {iCap: Interactive Image Captioning with Predictive Text},
author = {Zhengxiong Jia and Xirong Li},
journal= {arXiv preprint arXiv:2001.11782},
year = {2020}
}