中文

基于诊断性提示的多模态大语言模型视觉复杂性评估:亚马逊搜索结果页面案例研究

计算机视觉与模式识别 2025-12-02 v1

摘要

本研究探讨诊断性提示(diagnostic prompting)是否可提升多模态大语言模型(MLLM)在评估亚马逊搜索结果页面(SRP)视觉复杂性方面的可靠性。我们使用200个亚马逊SRP页面以及人类专家标注,比较诊断性提示与基于普罗韦斯原理的标准提示。实验结果表明,诊断性提示在预测人类复杂性判断方面显著提升,F1分数从0.031提升至0.297(提升858%),尽管绝对性能仍有限(Cohen's κ\kappa = 0.071)。决策树分析揭示,模型更重视视觉设计元素(徽标杂乱:38.6%重要性),而人类更关注内容相似度,表明两者在推理模式上存在部分一致性。失败案例分析显示,MLLM在视觉感知方面仍面临持续挑战,尤其是产品相似性和颜色强度评估。我们的发现表明,诊断性提示代表了人类对齐MLLM评估的有前景的初始步骤,尽管存在持续的人类-MLLM一致性 disagreement 的案例,需要进一步的研究和改进,以更大范围的真实数据集实现可靠的实际部署。

关键词

引用

@article{arxiv.2512.00082,
  title  = {Exploring Diagnostic Prompting Approach for Multimodal LLM-based Visual Complexity Assessment: A Case Study of Amazon Search Result Pages},
  author = {Divendar Murtadak and Yoon Kim and Trilokya Akula},
  journal= {arXiv preprint arXiv:2512.00082},
  year   = {2025}
}

备注

9 pages, 4 figures, 9 tables. Study on diagnostic prompting for multimodal LLM-based visual complexity assessment of Amazon search result pages