中文

VideoSTF:视频大语言模型输出重复的压力测试框架

计算机视觉与模式识别 2026-02-12 v1 密码学与安全 多媒体

摘要

视频大语言模型(VideoLLMs)最近在视频理解任务中取得了显著的性能。然而,我们发现了一个尚未被充分探讨的生成失效:严重的输出重复,即模型退化为重复短语或句子的自强化循环。这种失效模式未被现有 VideoLLM 基准所捕捉,这些基准主要关注任务准确性和事实正确性。我们提出了 VideoSTF,即系统性测量和压力测试 VideoLLM 输出重复的框架。VideoSTF 使用三种互补的 n-gram 基础指标来形式化重复,并提供一个包含 10,000 个多样化视频以及受控时间转换库的标准化测试基准。通过 VideoSTF,我们进行了普遍测试、时间压力测试和对抗性利用,对 10 个先进的 VideoLLMs 进行测试。我们发现输出重复普遍存在且高度敏感于视频输入的时间扰动。而且,我们表明简单的时间转换可高效诱导黑盒设置下的重复退化,暴露出输出重复作为可被利用的安全漏洞。我们的结果揭示了输出重复作为现代 VideoLLMs 中的根本性稳定性问题,并激励视频语言系统的稳定性感知评估。我们的评估代码和脚本已公开:https://github.com/yuxincao22/VideoSTF_benchmark。

关键词

引用

@article{arxiv.2602.10639,
  title  = {VideoSTF: Stress-Testing Output Repetition in Video Large Language Models},
  author = {Yuxin Cao and Wei Song and Shangzhi Xu and Jingling Xue and Jin Song Dong},
  journal= {arXiv preprint arXiv:2602.10639},
  year   = {2026}
}