AVMeme Exam:评估大型语言模型语境与文化知识与思维的多模态多语言多元文化基准
声音
2026-01-27 v1 计算与语言
计算机视觉与模式识别
多媒体
音频与语音处理
摘要
互联网视听片段通过随时间变化的声音和动作传达意义,这超出了文本所能单独表示的范围。为了检验AI模型能否在人类文化语境中理解此类信号,我们引入了AVMeme Exam,这是一个人工策划的基准,包含超过一千个标志性的互联网声音和视频,涵盖语音、歌曲、音乐和音效。每个模因都配有一个独特的问答对,评估从表面内容到语境、情感、用法和世界知识等不同层次的理解,以及原始年份、转录文本、摘要和敏感性等元数据。我们使用该基准系统地评估了最先进的多模态大语言模型以及人类参与者。我们的结果揭示了一个一致的局限性:当前模型在无文本音乐和音效上表现不佳,并且与表面内容相比,难以在语境和文化中进行思考。这些发现突显了人类对齐的多模态智能中的一个关键差距,并呼吁模型能够在其所听所见表面之外进行语境和文化感知。项目页面:avmemeexam.github.io/public
引用
@article{arxiv.2601.17645,
title = {AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking},
author = {Xilin Jiang and Qiaolin Wang and Junkai Wu and Xiaomin He and Zhongweiyang Xu and Yinghao Ma and Minshuo Piao and Kaiyi Yang and Xiuwen Zheng and Riki Shimizu and Yicong Chen and Arsalan Firoozi and Gavin Mischler and Sukru Samet Dindar and Richard Antonello and Linyang He and Tsun-An Hsieh and Xulin Fan and Yulun Wu and Yuesheng Ma and Chaitanya Amballa and Weixiong Chen and Jiarui Hai and Ruisi Li and Vishal Choudhari and Cong Han and Yinghao Aaron Li and Adeen Flinker and Mounya Elhilali and Emmanouil Benetos and Mark Hasegawa-Johnson and Romit Roy Choudhury and Nima Mesgarani},
journal= {arXiv preprint arXiv:2601.17645},
year = {2026}
}
备注
avmemeexam.github.io/public