中文

思维轨迹有重要作用吗?评估Gemini 视觉语言模型视频场景理解中的推理

计算机视觉与模式识别 2026-04-14 v1

摘要

我们基准测试内部推理轨迹(我们称为思维流)对视觉语言模型视频场景理解的影响。我们使用来自Google Gemini 2.5 Flash和Flash Lite四种配置,针对从100小时视频中提取的场景提出三个问题:更多思考是否导致更好的输出,收益何时达到顶点,这些模型实际上在思考什么?我们引入了三个评估指标:Contentfulness衡量思维流中有用场景内容与元评论的比例;Thought-Final Coverage衡量思维流如何忠实地转化为最终输出;Dominant Entity Analysis识别模型关注的主体、动作和场景。GPT-5作为独立裁判。我们发现,额外思考带来的质量提升迅速达到平台期,大多数改进发生在前几个百token。Flash Lite在质量和token使用之间提供了最佳平衡。紧张的推理预算会导致模型在最终输出中添加它从未思考过的内容,这是一种压缩步骤的幻觉。尽管Flash和Flash Lite属于不同模型等级,却产生类似的思维流,尽管风格不同:Flash讨论其推理过程,而Lite专注于描述场景。

关键词

引用

@article{arxiv.2604.11177,
  title  = {Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding},
  author = {Shivam Sharma and Sankalp Nagaonkar and Ashish Choithani and Ashutosh Trivedi},
  journal= {arXiv preprint arXiv:2604.11177},
  year   = {2026}
}