GODBench:面向视频评论艺术的多模态大语言模型基准
计算与语言
2025-05-22 v2 人工智能
摘要
视频评论艺术通过提供传达幽默、讽刺或情感共鸣的创意内容来增强用户参与度,这需要对文化和语境细微差别有细致而全面的把握。尽管多模态大语言模型 (MLLM) 和思维链 (CoT) 在 STEM 任务(如数学和编程)中展现了强大的推理能力,但它们仍然难以生成富有共鸣的笑话和深刻讽刺等创意表达。此外,现有的基准受限于其模态单一和类别不足,阻碍了对基于视频的评论艺术创作中全面创造力的探索。为解决这些局限性,我们引入了 GODBench,一个整合了视频和文本模态的新基准,用于系统地评估 MLLM 创作评论艺术的能力。此外,受物理学中波的传播模式启发,我们提出了思维涟漪 (RoT),一个旨在增强 MLLM 创造力的多步推理框架。大量实验表明,现有的 MLLM 和 CoT 方法在理解和生成创意视频评论方面仍面临重大挑战。相比之下,RoT 提供了一种提高创意创作的有效方法,凸显了其在推动基于 MLLM 的创造力方面取得有意义进展的潜力。GODBench 已公开可用,地址为 https://github.com/stan-lei/GODBench-ACL2025。
引用
@article{arxiv.2505.11436,
title = {GODBench: A Benchmark for Multimodal Large Language Models in Video Comment Art},
author = {Yiming Lei and Chenkai Zhang and Zeming Liu and Haitao Leng and Shaoguo Liu and Tingting Gao and Qingjie Liu and Yunhong Wang},
journal= {arXiv preprint arXiv:2505.11436},
year = {2025}
}
备注
69 pages, 66 figures, accepted by ACL 2025