FigCaps-HF:一种带人类反馈的图生 caption 生成框架与基准
计算与语言
2025-06-18 v2 计算机视觉与模式识别
机器学习
摘要
caption对于理解科学可视化与文档至关重要。现有的科学图表caption生成方法依赖于从文档中提取的图-caption对进行训练,其中许多在有用性、可解释性和视觉描述性等指标上有所欠缺[15],导致生成的caption与读者偏好不一致。为生成高质量图表caption,我们提出FigCaps-HF,一种新颖的图生caption生成框架,可在生成caption时融入领域专家反馈以优化读者偏好。我们的框架包括:1)一种自动评估图-caption对质量的方法;2)一种新颖的带人类反馈的强化学习(RLHF)方法,用于针对读者偏好优化生成式图生caption模型。我们通过在不同类型模型上超越标准微调的性能,证明了这一简单学习框架的有效性。特别地,当使用BLIP作为基础模型时,我们的RLHF框架在ROUGE、BLEU和Meteor上分别实现了35.7%、16.9%和9%的平均提升。最后,我们发布了一个带有图-caption对人类反馈的大规模基准数据集,以促进针对该问题的RLHF技术的进一步评估与开发。
引用
@article{arxiv.2307.10867,
title = {FigCaps-HF: A Figure-to-Caption Generative Framework and Benchmark with Human Feedback},
author = {Ashish Singh and Ashutosh Singh and Prateek Agarwal and Zixuan Huang and Arpita Singh and Tong Yu and Sungchul Kim and Victor Bursztyn and Nesreen K. Ahmed and Puneet Mathur and Erik Learned-Miller and Franck Dernoncourt and Ryan A. Rossi},
journal= {arXiv preprint arXiv:2307.10867},
year = {2025}
}
备注
16 pages, 4 figures. Benchmark Documentation: https://figcapshf.github.io/