WikiVideo:来自多个视频的文章生成
计算机视觉与模式识别
2025-10-23 v2 计算与语言
摘要
我们提出基于视频的受控文章生成任务,旨�从多个关于真实事件(如自然灾害或政治选举)的视频中生成维基百科风格的文章——其中所有文章信息均由视频证据支持。视频作为检索增强生成(RAG)的直观来源,但大多数当代RAG工作流程侧重文本,而现有视频摘要方法关注低层次场景理解,而非高层次事件语义。为弥合这一差距,我们提出WikiVideo,一个包含专家编写的文章和密集标注视频的数据集,后者为文章论点提供证据,促进视频融入RAG管道,实现基于多模态来源的深入内容创建。我们进一步提出协作式文章生成(CAG),一种从多个视频中创建文章的新颖交互方法。CAG利用推理模型与VideoLLM之间的迭代交互,比VideoLLM单独能对目标事件做出更高层次的推断,而后者仅关注低层视觉特征。我们对最新SOTA VideoLLM和CAG在oracle检索和RAG设置下进行基准测试,发现CAG一致优于替代方法,并为未来工作指出了有趣的方向。
引用
@article{arxiv.2504.00939,
title = {WikiVideo: Article Generation from Multiple Videos},
author = {Alexander Martin and Reno Kriz and William Gantt Walden and Kate Sanders and Hannah Recknor and Eugene Yang and Francis Ferraro and Benjamin Van Durme},
journal= {arXiv preprint arXiv:2504.00939},
year = {2025}
}
备注
Repo can be found here: https://github.com/alexmartin1722/wikivideo