尽情于画框中:C$^3$B——基于漫画的多模态文化意识基准测试
计算机视觉与模式识别
2026-03-03 v2 人工智能
摘要
文化意识能力已成为多模态大语言模型(MLLM)的关键能力。然而,当前基准测试在任务设计上缺乏进阶难度,跨语言任务方面也薄弱。此外,现有基准测试常使用真实图片,而每张真实图片通常只包含一种文化,使得这些基准测试对 MLLM 来说相对容易。基于此,我们提出了 CB(Comics Cross-Cultural Benchmark,漫画跨文化基准测试),一种新型的多文化、多任务和多语言文化意识能力基准测试。CB 包含 2000 多张图片和 18000 多对问答数据,基于三个任务构建,难度逐级提升,从基础视觉识别到高级文化冲突理解,再到文化内容生成。我们对 11 个开源 MLLM 进行了评估,发现 MLLM 与人类性能之间存在显著差距。该差距表明 CB 对当前 MLLM 构成重大挑战,鼓励未来研究推动 MLLM 的文化意识能力发展。
引用
@article{arxiv.2510.00041,
title = {Culture In a Frame: C$^3$B as a Comic-Based Benchmark for Multimodal Culturally Awareness},
author = {Yuchen Song and Andong Chen and Wenxin Zhu and Kehai Chen and Xuefeng Bai and Muyun Yang and Tiejun Zhao},
journal= {arXiv preprint arXiv:2510.00041},
year = {2026}
}