ViSIL:多模态视频描述中信息损失的统一评估
计算机视觉与模式识别
2026-01-28 v2 人工智能
人机交互
摘要
多模态视频描述将密集的影像浓缩为关键帧和自然语言的结构化格式。通过创建连贯的多模态摘要,该方法将生成式人工智能锚定在丰富的语义证据中,并作为高效检索的轻量级代理。然而,像 BLEU 或 ROUGE 这样的传统指标无法量化跨不同模态的信息覆盖度,例如将一段文本与一系列关键帧进行比较。为了解决这个问题,我们提出了视频摘要信息损失(ViSIL)分数,这是一个信息论框架,通过视觉-语言模型(VLM)推理来量化摘要未捕获的视频信息。通过测量信息损失,ViSIL 成为一个统一的指标,能够在结构差异下直接比较多模态摘要格式。我们的结果表明,ViSIL 分数与人类和 VLM 在视频问答(VQA)任务上的表现具有统计显著的相关性。ViSIL 还能实现摘要选择,以优化信息损失和处理速度之间的权衡,建立了一个帕累托最优前沿,在不增加处理负载的情况下,将 VQA 准确率提高了 。
引用
@article{arxiv.2601.09851,
title = {ViSIL: Unified Evaluation of Information Loss in Multimodal Video Captioning},
author = {Po-han Li and Shenghui Chen and Ufuk Topcu and Sandeep Chinchali},
journal= {arXiv preprint arXiv:2601.09851},
year = {2026}
}