中文

VideoNorms:视频语言模型文化意识的基准测试

计算机视觉与模式识别 2025-10-10 v1 人工智能 计算与语言 计算机与社会

摘要

随着Video大语言模型(VideoLLM)在全球范围内的部署,其需要理解并建立在相关文化背景上的 grounding。为充分评估这些模型的文化意识,亟需提供充分的基准测试。我们引入VideoNorms,一个包含1000多组(视频片段、规范)配对的基准,涵盖美中两种文化,标注包含基于言语行为理论的规范、遵守/违反标签以及言语与非言语证据。为构建VideoNorms,我们采用人类-人工协作框架:教师模型通过理论驱动的提示提供候选标注,经训练的人类专家验证并纠正标注。我们对多种开源VideoLLM在新数据集上的表现进行基准测试,揭示若干常见趋势:1)模型在规范违反(而非遵守)方面表现较差;2)模型在中国文化方面表现低于美国文化;3)模型在提供非言语证据方面较言语证据更具挑战性,且难以识别与言语行为对应的具体规范;4)与人类不同,模型在正式、非幽默情境中表现更差。我们的发现凸显了需要文化嵌入式视频语言模型训练的需求——本基准测试与框架旨在逐步填补这一空白。

关键词

引用

@article{arxiv.2510.08543,
  title  = {VideoNorms: Benchmarking Cultural Awareness of Video Language Models},
  author = {Nikhil Reddy Varimalla and Yunfei Xu and Arkadiy Saakyan and Meng Fan Wang and Smaranda Muresan},
  journal= {arXiv preprint arXiv:2510.08543},
  year   = {2025}
}

备注

24 pages, 5 figures, under review