中文

随心视觉描述:由少量风格化句子引导的图像与视频描述生成

多媒体 2023-08-01 v1 计算机视觉与模式识别

摘要

风格化视觉描述旨在以特定风格生成图像或视频描述,使其更具吸引力且情感贴切。该任务的一大挑战是缺乏视觉内容对应的风格化描述配对,因此多数现有工作聚焦于不依赖平行数据集的无监督方法。然而,这些方法仍需要使用带风格标签的充足样本进行训练,且生成的描述局限于预定义风格。为克服这些局限,我们探索少样本风格化视觉描述问题,其目标是在推理时仅以少量示例作为引导、无需进一步训练即可生成任意所需风格的描述。我们针对该任务提出名为 FS-StyleCap 的框架,其利用条件式编码器-解码器语言模型与视觉投影模块。我们的两步训练方案如下:首先,在仅含文本的无标注语料上训练风格提取器以生成风格表示;然后冻结提取器,使解码器能基于提取的风格向量与投影后的视觉内容向量生成风格化描述。推理时,模型可通过从用户提供的示例中提取风格表示来生成所需的风格化描述。我们在少样本情感视觉描述上的自动评估结果优于最先进方法,并与在带标签风格语料上充分训练的模型相当。人工评估进一步证实了模型处理多种风格的能力。

关键词

引用

@article{arxiv.2307.16399,
  title  = {Visual Captioning at Will: Describing Images and Videos Guided by a Few Stylized Sentences},
  author = {Dingyi Yang and Hongyu Chen and Xinglin Hou and Tiezheng Ge and Yuning Jiang and Qin Jin},
  journal= {arXiv preprint arXiv:2307.16399},
  year   = {2023}
}

备注

9 pages, 6 figures