中文

利用带有人类反馈的强化学习增强图像字幕生成

计算机视觉与模式识别 2024-03-12 v1 人工智能

摘要

关于生成人类对齐/人类偏好输出的生成模型的研究最近取得了显著贡献。在文本和图像生成模型之间,我们将重点缩小到基于文本的生成模型,特别是生成符合人类偏好的图像字幕。在本研究中,我们探索了一种潜在方法来放大深度神经网络模型的性能,以生成人类偏好的字幕。这是通过结合监督学习和带有人类反馈的强化学习 (RLHF),并使用 Flickr8k 数据集实现的。此外,还引入了一种能够基于人类反馈优化模型的新颖损失函数。在本文中,我们提供了我们方法和结果的简要概述,希望为人类对齐生成式 AI 模型领域的持续进步做出贡献。

关键词

引用

@article{arxiv.2403.06735,
  title  = {Enhancing Image Caption Generation Using Reinforcement Learning with Human Feedback},
  author = {Adarsh N L and Arun P and Aravindh N L},
  journal= {arXiv preprint arXiv:2403.06735},
  year   = {2024}
}

备注

6 Pages, 8 figures