中文

面向可适应与交互式图像描述的数据增强与情景记忆方法

计算与语言 2024-08-09 v1 计算机视觉与模式识别

摘要

交互式机器学习(IML)在数据有限的情况下是一种有益的学习范式,因为人类反馈会被逐步整合进训练过程。本文提出一种用于图像描述(image captioning)的 IML 流程,使我们能够基于用户输入将预训练的图像描述模型逐步适应到新的数据分布。为将用户输入融入模型,我们探索结合多种简单数据增强方法,以对每个新标注数据实例获取更大的数据批次,并实现持续学习方法以防止重复更新带来的灾难性遗忘。在实验中,我们将一个特定领域的图像描述数据集(即 VizWiz)划分为互不重叠的部分,以模拟增量输入流,从而持续使模型适应新数据。我们发现,尽管数据增强会使结果变差,但即使在可用数据量相对较少时,情景记忆(episodic memory)仍是保留先前所见簇知识的有效策略。

关键词

引用

@article{arxiv.2306.03500,
  title  = {Towards Adaptable and Interactive Image Captioning with Data Augmentation and Episodic Memory},
  author = {Aliki Anagnostopoulou and Mareike Hartmann and Daniel Sonntag},
  journal= {arXiv preprint arXiv:2306.03500},
  year   = {2024}
}