中文

视频摘要:迈向实体感知的字幕生成

计算机视觉与模式识别 2024-11-12 v2 人工智能 计算与语言 多媒体

摘要

现有的主流视频字幕生成基准和模型处理的是缺乏特定人物、地点或组织命名实体的通用字幕。相比之下,新闻视频呈现出一种具有挑战性的场景,其字幕需要包含此类命名实体才能实现有意义的摘要。因此,我们提出了将新闻视频直接摘要为实体感知字幕的任务。我们还发布了一个大规模数据集 VIEWS (VIdeo NEWS),以支持针对该任务的研究。此外,我们提出了一种方法,将视频中的视觉信息与从外部世界知识中检索到的上下文相结合,以生成实体感知的字幕。我们在三个视频字幕生成模型上展示了该方法的有效性。我们还表明,我们的方法可泛化至现有的新闻图像字幕数据集。凭借所有广泛的实验与见解,我们相信为这一挑战性任务的未来研究奠定了坚实的基础。

关键词

引用

@article{arxiv.2312.02188,
  title  = {Video Summarization: Towards Entity-Aware Captions},
  author = {Hammad A. Ayyubi and Tianqi Liu and Arsha Nagrani and Xudong Lin and Mingda Zhang and Anurag Arnab and Feng Han and Yukun Zhu and Jialu Liu and Shih-Fu Chang},
  journal= {arXiv preprint arXiv:2312.02188},
  year   = {2024}
}