VIBE:面向TL;DR的无标注视频到文本信息瓶颈评估
计算机视觉与模式识别
2025-09-24 v3 人机交互
信息论
math.IT
摘要
许多决策任务在准确性和效率之间仍需要人工监督。例如,交通警察审核长达数小时的车载摄像头录像,或研究人员筛选会议视频时,都能从简洁的摘要中获益,这些摘要能降低认知负荷并节省时间。然而,当前的视觉语言模型(VLM)常常生成冗长、重复的内容,阻碍任务性能。现有的视频描述评估依赖高昂的人工标注,同时忽视了摘要在下游任务中的实用性。我们提出了视频到文本信息瓶颈评估(Video-to-text Information Bottleneck Evaluation, VIBE),一种无需标注的方法,通过两种指标对VLM输出进行评分: grounding(摘要与视觉内容对齐程度)和 utility(对任务信息量的程度)。VIBE从随机抽样的VLM输出中选择,通过对两种分数进行排序,以支持有效的人类决策。在 LearningPaper24、SUTD-TrafficQA 和 LongVideoBench 上的人类研究表明,VIBE所选摘要相较于 naive VLM 摘要或原始视频,使任务准确率提升最高可达 61.23%,响应时间缩短 75.77%。
引用
@article{arxiv.2505.17423,
title = {VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR},
author = {Shenghui Chen and Po-han Li and Sandeep Chinchali and Ufuk Topcu},
journal= {arXiv preprint arXiv:2505.17423},
year = {2025}
}