Polos:基于人类反馈的多模态指标学习用于图像描述生成
计算机视觉与模式识别
2024-02-29 v1 人工智能
计算与语言
摘要
建立与人类判断高度一致的自动评估指标对于有效开发图像描述模型至关重要。最近的数据驱动指标相比诸如 CIDEr 等经典指标,已显示出更强的与人类判断相关性;然而它们在处理幻觉问题以及在多样化的图像和文本之间泛化方面仍存在不足,这主要因为它们仅计算基于与图像描述评估无关任务学习得到的嵌入表示的标量相似度。在本研究中,我们提出了 Polos,这是一个针对图像描述模型的监督式自动评估指标。Polos 通过多模态输入计算得分,采用并行特征提取机制,利用通过大规模对比学习训练的嵌入表示。为训练 Polos,我们引入了基于人类反馈的多模态指标学习框架(MLHF),用于开发基于人类反馈的评估指标。我们构建了 Polaris 数据集,包含来自 550 名评估者的 13.1 万条人类判断,这一规模约为常用数据集的十倍。我们的方法在 Composite、Flickr8K-Expert、Flickr8K-CF、PASCAL-50S、FOIL 以及 Polaris 数据集上实现了最新的性能,从而证明了其有效性和鲁棒性。
引用
@article{arxiv.2402.18091,
title = {Polos: Multimodal Metric Learning from Human Feedback for Image Captioning},
author = {Yuiga Wada and Kanta Kaneda and Daichi Saito and Komei Sugiura},
journal= {arXiv preprint arXiv:2402.18091},
year = {2024}
}
备注
CVPR 2024