通过模仿人类改写反馈提升图像字幕
计算机视觉与模式识别
2025-01-09 v1 计算与语言
摘要
将自动预测的人类反馈纳入生成模型训练过程的反馈在近期引起广泛关注,而推断时的反馈则受到较少关注。通常的训练时反馈(即在两个样本中选择的偏好)难以自然地转化到推断阶段。我们提出了一种新型反馈——字幕改写反馈,并训练模型基于人类注释模拟改写反馈。该方法无需对图像字幕模型本身进行训练,从而大幅降低计算需求。我们实验了两种改写反馈类型:首先,我们收集了人类改写数据集,用于纠正生成字幕中的错误。我们发现,将基于此数据训练的改写模型融入现有图像字幕模型的推断阶段后,字幕质量得到提升,尤其在原始字幕质量较低时效果更为显著。我们将该方法应用于非英语图像字幕,由于稳健模型在该领域相对不足,改进效果尤为突出。其次,我们将改写应用于风格迁移。定量评估显示,在德语图像字幕和英语风格迁移方面实现了最先进的性能,而人类验证采用详细的比较框架暴露了具体的改进维度。
引用
@article{arxiv.2501.04513,
title = {Improving Image Captioning by Mimicking Human Reformulation Feedback at Inference-time},
author = {Uri Berger and Omri Abend and Lea Frermann and Gabriel Stanovsky},
journal= {arXiv preprint arXiv:2501.04513},
year = {2025}
}