视频大语言模型真的在看吗?诊断长视频中的角色跟踪失败
计算机视觉与模式识别
2026-07-13 v1 人工智能
摘要
视频大语言模型(Video-LLM)能否在长视频中跟踪一个人,足够好地记住他们是谁,以便按顺序报告他们的服装在整个电视节目中的变化?基准测试越来越多地对这类任务进行评分,最强的开源7-8B模型现在在InfiniBench的全局外观任务上达到37-38%,该任务正是要求这样做。但这个分数是来自跟踪指定的角色,还是来自更简单的东西?我们使用一个九条件诊断协议对三个架构不同的开源Video-LLM进行了测试,并以Gemini 2.5 Flash作为前沿参考,发现准确性并非来自角色跟踪。当我们把问题中指定的角色换成另一个演员,而视频和答案选项保持不变时,模型只有4-31%的时间改变答案,因此它们在很大程度上忽略了问题询问的是谁。按交换名字的性别细分该测试可以看出原因:当名字换成不同性别的角色时,模型的反应比换成同性别的角色更大(差距为13-28个百分点),捕捉到了粗略的性别线索,但无法区分同性别个体。当我们去掉多项选择选项并以开放式方式提出相同问题时,这种浅层处理再次出现:开源准确性下降18-25个百分点,151个答案中没有一个是完全正确的,而Gemini下降了12个百分点。进一步的检查排除了明显的无辜解释,添加字幕、使用信息量最大的帧或加倍帧数都没有改善角色跟踪,因此瓶颈不在于模型看到了多少视频,而在于它如何将视频与问题中命名的人联系起来。我们发布了一个诊断工具包,用于审计此类基准分数实际衡量的内容。
引用
@article{arxiv.2607.11078,
title = {Do Video-LLMs Actually Watch? Diagnosing Character-Tracking Failures in Long-Form Video},
author = {Mohammad Al-Ratrout and Shayla Sharmin and Aditya Raikwar and Roghayeh Leila Barmaki},
journal= {arXiv preprint arXiv:2607.11078},
year = {2026}
}