利用基准和对齐学习提升图像描述生成的细致程度
空间物理
2025-08-19 v2
摘要
图像描述生成长期以来是视觉理解中的关键任务,近期视觉-语言模型(VLM)的进展显著提升了生成详细图像描述的能力。然而,由于评估指标过时且注释粗糙,详细图像描述的评估尚未得到充分探索。本文引入DeCapBench,以及专为详细描述任务设计的新型指标DCScore。DCScore通过将响应解构为最小自足单元(称为原始信息单元)并逐个评估来评估幻觉和细粒度完整性。我们的评估表明,DCScore与人类判断的一致性更高,优于其他基于规则或基于模型的指标。同时,DeCapBench在描述性任务上与VLM竞技场结果高度相关,优于现有基准。此外,我们提出一种自动细粒度反馈收集方法FeedQuill,用于基于先进指标的偏好优化,显示出在跨自动生成偏好数据上的鲁棒泛化能力。针对多个VLM进行的大量实验表明,我们的方法不仅显著减少了幻觉,还在各种基准测试中提升了性能,实现了卓越的细致描述生成性能,超越GPT-4o。
引用
@article{arxiv.2503.07905,
title = {Investigating the Dependence of Normalized Reconnection Rate on Upstream Plasma Parameters},
author = {S. V. Heuer and K. J. Genestreti and Y. -H Liu and J. R. Shuster and X. Li and R. B. Torbert and J. L. Burch},
journal= {arXiv preprint arXiv:2503.07905},
year = {2025}
}