面向少样本视觉叙事的话题自适应与原型编码
计算与语言
2020-08-12 v1 计算机视觉与模式识别
信息检索
机器学习
摘要
视觉叙事(Visual Storytelling,VIST)是一项根据给定照片流就某一话题讲述叙事性故事的任务。现有研究侧重于设计复杂模型,其依赖于大量人工标注数据。然而,VIST 的标注极其昂贵,且由于长尾话题分布,许多话题无法被训练数据集覆盖。本文中,我们通过考虑少样本设定来增强 VIST 模型的泛化能力。受人类讲故事方式启发,我们提出一种话题自适应讲述器来建模跨话题泛化能力。实践中,我们在多模态 seq2seq 模型上应用基于梯度的元学习算法,以赋予模型快速从一个话题适应到另一话题的能力。此外,我们进一步提出原型编码结构来建模话题内推导能力。具体而言,我们将少量训练故事文本编码并还原,作为推理时引导生成的参考。实验结果表明,话题自适应与原型编码结构在 BLEU 和 METEOR 指标上相互为少样本模型带来增益。进一步的案例研究表明,经过少样本适配后生成的故事更具相关性和表现力。
引用
@article{arxiv.2008.04504,
title = {Topic Adaptation and Prototype Encoding for Few-Shot Visual Storytelling},
author = {Jiacheng Li and Siliang Tang and Juncheng Li and Jun Xiao and Fei Wu and Shiliang Pu and Yueting Zhuang},
journal= {arXiv preprint arXiv:2008.04504},
year = {2020}
}
备注
ACM Multimedia 2020