DualFact+:面向过程视频理解的多模态事实验证框架
人工智能
2026-04-29 v1
摘要
我们引入了 DualFact,一个用于过程视频字幕生成的双层多模态事实性评估框架。DualFact 将事实正确性分为概念事实(捕捉抽象语义角色,如动作、原料、工具、位置)和上下文事实(捕捉它们在视频中落地的谓词-论元实现)。为了支持完整且角色一致的评估,DualFact 结合了隐式论元增强(VIA)和对比事实集。我们将 DualFact 实例化为两种模式:DualFact-T(根据文本证据验证事实)和 DualFact-V(根据视频落地的视觉证据验证事实)。在 YouCook3-Fact 和 CraftBench-Fact 上的实验表明,最先进的多模态语言模型生成的字幕虽然流畅,但往往在事实上不完整,存在系统性遗漏和角色层面的不一致。DualFact 与人类事实性判断的相关性比标准指标更强,特别是在上下文事实方面;并揭示了与基于视频落地的验证相比,仅依赖字幕的评估高估了幻觉现象。总体而言,DualFact 提供了一种可解释且与人类对齐的评估协议,突出了多模态事实落地中持续存在的挑战,超越了表层的流畅性。
引用
@article{arxiv.2604.25584,
title = {DualFact+: A Multimodal Fact Verification Framework for Procedural Video Understanding},
author = {Cennet Oguz and Yasser Hamidullah and Josef van Genabith and Simon Ostermann},
journal= {arXiv preprint arXiv:2604.25584},
year = {2026}
}
备注
ACL 2026 Findings