中文

视频模型有多自信?赋予视频模型表达其不确定性的能力

计算机视觉与模式识别 2025-10-06 v1 人工智能 计算与语言

摘要

生成式视频模型展示了令人印象深刻的文本到视频能力,促使其在许多实际应用中被广泛采用。然而,与大型语言模型(LLM)类似,视频生成模型倾向于产生幻觉,即使在事实上错误也会生成看似合理的视频。尽管先前的工作已对 LLM 的不确定性量化(UQ)进行了广泛研究,但目前尚不存在针对视频模型的 UQ 方法,这引发了关键的安全隐患。据我们所知,本文是迈向量化视频模型不确定性的首项工作。我们提出了一个用于生成式视频模型不确定性量化的框架,包括: 一个基于稳健秩相关估计且无严格建模假设的视频模型校准评估指标; 一种针对视频模型 termed S-QUBED 的黑盒 UQ 方法,该方法利用潜在建模将预测不确定性严格分解为其偶然性和认知性成分;以及 一个用于促进视频模型校准基准测试的 UQ 数据集。通过在潜在空间中对生成任务进行条件化,我们将因任务规范模糊而产生的不确定性与因知识缺乏而产生的不确定性解开。通过对基准视频数据集的广泛实验,我们证明 S-QUBED 计算出的校准总不确定性估计与任务准确性呈负相关,并能有效计算偶然性和认知性成分。

关键词

引用

@article{arxiv.2510.02571,
  title  = {How Confident are Video Models? Empowering Video Models to Express their Uncertainty},
  author = {Zhiting Mei and Ola Shorinwa and Anirudha Majumdar},
  journal= {arXiv preprint arXiv:2510.02571},
  year   = {2025}
}