中文

VC-Inspector:通过事实分析推进视频描述的无参考评价

计算机视觉与模式识别 2026-04-21 v3 计算与语言

摘要

我们提出了 VC-Inspector,一个轻量级、开源的大型多模态模型(LMM),用于视频描述的无参考评价,重点关注事实准确性。与现有指标受限于有限的上下文处理能力、薄弱的事实性评估或依赖专有服务不同,VC-Inspector 提供了一种可复现且注重事实的替代方案,其评价结果与人类判断高度一致。为了实现稳健训练和可解释的评价,我们引入了一个系统框架,用于生成带有可控事实错误的描述,并配以分级质量评分和解释性注释。实验表明,VC-Inspector 在与人类判断的相关性上达到了最先进水平,能够跨不同领域(如 VATEX-Eval、Flickr8K-Expert 和 Flickr8K-CF 基准)泛化,并揭示了改进描述质量的潜力。项目页面见 https://dipta007.github.io/VC-Inspector。

关键词

引用

@article{arxiv.2509.16538,
  title  = {VC-Inspector: Advancing Reference-free Evaluation of Video Captions with Factual Analysis},
  author = {Shubhashis Roy Dipta and Tz-Ying Wu and Subarna Tripathi},
  journal= {arXiv preprint arXiv:2509.16538},
  year   = {2026}
}

备注

Accepted at ACL 2026 (Main)