中文

多模态大语言模型创意评估的因果感知范式

人工智能 2025-02-25 v2 人机交互

摘要

最近开发了诸多基准测试来评估大语言模型(LLM)的逻辑推理能力。然而,评估LLM同样重要的创意能力具有主观、多样且数据稀缺的挑战,尤其是在多模态场景中。本文考虑了评估多模态LLM创意的全面管道,重点关注合适的评估平台和方法。首先,我们发现Oogiri游戏——一种需要幽默、联想思维以及生成意外响应的创意驱动任务——与现代多模态LLM的输入输出结构良好匹配,并受益于丰富的高质量、人工标注的创意响应储存库,这使其成为研究LLM创意的理想平台。接下来,除了使用Oogiri游戏进行排名和选择等标准评估外,我们提出了LoTbench——一个交互式、因果感知的评估框架,以进一步解决标准评估中如信息泄露和可解释性有限等内在风险。提出的LoTbench不仅更有效地量化了LLM的创意,还可可视化底层创意思维过程。我们的结果表明,虽然大多数LLM表现出受限的创意,但LLM与人类之间的性能差距并非不可逾越。此外,我们观察到来自多模态认知基准测试MMMU和LoTbench之间存在较强相关性,但与传统创意指标之间仅存在弱联系。这表明LoTbench更贴合人类认知理论,突显认知在创意早期阶段的关键作用,并实现了不同概念之间的桥接。https://lotbench.github.io

关键词

引用

@article{arxiv.2501.15147,
  title  = {A Causality-aware Paradigm for Evaluating Creativity of Multimodal Large Language Models},
  author = {Zhongzhan Huang and Shanshan Zhong and Pan Zhou and Shanghua Gao and Marinka Zitnik and Liang Lin},
  journal= {arXiv preprint arXiv:2501.15147},
  year   = {2025}
}

备注

Accepted by TPAMI. arXiv admin note: text overlap with arXiv:2312.02439