中文

用于图像字幕生成的交互式机器学习

计算机视觉与模式识别 2022-03-01 v1 计算与语言

摘要

我们提出一种用于图像字幕生成模型的交互式学习方法。由于人类反馈成本高昂,且现代基于神经网络的方案通常需大量监督数据训练,我们设想一种系统,通过数据增强方法成倍利用反馈,并以巧妙方式将所得训练样本整合进模型,从而尽可能好地利用人类反馈。该方法有三个关键组件,我们需要为其找到合适的实际实现:反馈收集、数据增强和模型更新。我们概述了思路并回顾了应对这些任务的不同可能方案。

关键词

引用

@article{arxiv.2202.13623,
  title  = {Interactive Machine Learning for Image Captioning},
  author = {Mareike Hartmann and Aliki Anagnostopoulou and Daniel Sonntag},
  journal= {arXiv preprint arXiv:2202.13623},
  year   = {2022}
}