中文

VMDT:解码视频基础模型的可信度

计算机视觉与模式识别 2025-11-11 v1 机器学习

摘要

随着基础模型日益复杂,确保其可信度变得越来越关键;然而,与文本和图像不同,视频模态仍缺乏全面的可信度基准。我们引入 VMDT(Video-Modal DecodingTrust),这是第一个用于评估文本到视频(T2V)和视频到文本(V2T)模型的统一平台,涵盖五个关键可信度维度:安全性、幻觉、公平性、隐私和对抗鲁棒性。通过我们的 VMDT 对7个 T2V 模型和19 个 V2T 模型进行广泛评估,我们发现了若干重要洞见。例如,所有评估的开源 T2V 模型都未能识别有害查询,常常生成有害视频,同时相较于图像模态模型表现出更高的不公平性。在 V2T 模型中,不公平性和隐私风险随规模上升,而幻觉和对抗鲁棒性则改善——尽管总体性能仍较低。独特的是,安全性与模型规模无关,这表明当前安全性水平由其他因素主导。我们的发现凸显了开发更可靠更可信视频基础模型的紧迫需求,VMDT 为衡量和追踪达成这一目标的进展提供了系统框架。代码已公开于 https://sunblaze-ucb.github.io/VMDT-page/。

关键词

引用

@article{arxiv.2511.05682,
  title  = {VMDT: Decoding the Trustworthiness of Video Foundation Models},
  author = {Yujin Potter and Zhun Wang and Nicholas Crispino and Kyle Montgomery and Alexander Xiong and Ethan Y. Chang and Francesco Pinto and Yuqi Chen and Rahul Gupta and Morteza Ziyadi and Christos Christodoulopoulos and Bo Li and Chenguang Wang and Dawn Song},
  journal= {arXiv preprint arXiv:2511.05682},
  year   = {2025}
}

备注

NeurIPS 2025 Datasets & Benchmarks