LLaVA-RE:基于多模态大语言模型的二值图像文本相关性评估
计算机视觉与模式识别
2025-08-08 v1
摘要
多模态生成式 AI 通常涉及给定另一种模态的输入来生成图像或文本响应。图像文本相关性评估对于衡量响应质量或排序候选响应至关重要。特别是二值相关性评估,即“相关”与“不相关”,是一个基础问题。然而,在考虑到文本具有多样格式且相关性定义在不同情景下各不相同的情况下,这是一项具有挑战性的任务。我们发现,多模态大语言模型(MLLM)是构建此类评估器的理想选择,因为它们能够灵活处理复杂文本格式并接收额外任务信息。在本文中,我们提出 LLaVA-RE,这是首个利用 MLLM 进行二值图像文本相关性评估的尝试。它遵循 LLaVA 架构,采用详细任务指令和多模态情境样本。此外,我们提出了一种新型二值相关性数据集,涵盖各种任务。实验结果验证了我们方法的有效性。
引用
@article{arxiv.2508.05602,
title = {LLaVA-RE: Binary Image-Text Relevancy Evaluation with Multimodal Large Language Model},
author = {Tao Sun and Oliver Liu and JinJin Li and Lan Ma},
journal= {arXiv preprint arXiv:2508.05602},
year = {2025}
}
备注
Published in the First Workshop of Evaluation of Multi-Modal Generation 2025