中文

多模态大语言模型视频理解中的可信性基准测试

计算机视觉与模式识别 2025-11-27 v3

摘要

近年来,用于视频理解的多模态大语言模型(videoLLMs)在处理复杂时空数据方面的能力得到了增强。然而,事实不准确、有害内容、偏见、幻觉和隐私风险等挑战损害了其可靠性。本研究引入了 Trust-videoLLMs,这是一个首个全面评估 23 种最先进视频 LLM(5 种商业模型、18 种开源模型)的基准测试,涵盖五个关键维度:真实性、鲁棒性、安全性、公平性和隐私性。该框架包含 30 个任务,采用改编、合成和标注视频,评估时空风险、时间一致性和跨模态影响。结果显示,在动态场景理解、跨模态扰动鲁棒性和现实风险缓解方面存在显著局限。虽然开源模型偶尔表现更优,但专有模型通常表现出更高的可信度,尽管扩展规模并不总能持续提升性能。这些发现强调了需要增强训练数据多样性和鲁棒的多模态对齐。Trust-videoLLMs 提供了一个公开可用、可扩展的工具包,用于标准化可信性评估,弥合了以准确性为中心的基准测试与对鲁棒性、安全性、公平性和隐私性需求之间的关键差距。

关键词

引用

@article{arxiv.2506.12336,
  title  = {Benchmarking the Trustworthiness in Multimodal LLMs for Video Understanding},
  author = {Youze Wang and Zijun Chen and Ruoyu Chen and Shishen Gu and Wenbo Hu and Jiayang Liu and Yinpeng Dong and Hang Su and Jun Zhu and Meng Wang and Richang Hong},
  journal= {arXiv preprint arXiv:2506.12336},
  year   = {2025}
}