中文

多模态搜索相关性判断中成本与准确性的权衡评估

机器学习 2024-10-29 v1 计算与语言 信息检索

摘要

大型语言模型(LLM)已展现出作为有效搜索相关性评估器的潜力。然而,对于哪些模型能在各种上下文中或在特定用例中持续保持最优表现,目前仍缺乏全面的指导。本文评估了多个 LLM 和多模态语言模型(MLLM)在多种多模态搜索场景下与人类判断的一致性。我们的分析考察了成本与准确率之间的权衡,指出模型性能因上下文而异且差异显著。有趣的是,在较小模型中,引入视觉组件可能不仅无益,反而会阻碍性能。这些发现突显了在实际应用中选择最合适模型所涉及的复杂性。

关键词

引用

@article{arxiv.2410.19974,
  title  = {Evaluating Cost-Accuracy Trade-offs in Multimodal Search Relevance Judgements},
  author = {Silvia Terragni and Hoang Cuong and Joachim Daiber and Pallavi Gudipati and Pablo N. Mendes},
  journal= {arXiv preprint arXiv:2410.19974},
  year   = {2024}
}