中文

MM-Narrator:基于多模态上下文学习叙述长视频

计算机视觉与模式识别 2023-11-30 v1 人工智能

摘要

我们提出 MM-Narrator,一种利用 GPT-4 与多模态上下文学习生成音频描述(AD)的新颖系统。与以往主要聚焦于使用短视频片段进行下游微调的方法不同,MM-Narrator 擅长以自回归方式生成长达数小时甚至更久视频的精确音频描述。这一能力得益于所提出的记忆增强生成过程,其通过高效的登记-回忆机制有效利用短期文本上下文与长期视觉记忆。这些上下文记忆汇编了相关的过往信息,包括故事线和角色身份,从而确保准确追踪并刻画故事连贯且以角色为中心的音频描述。在保持 MM-Narrator 免训练设计的同时,我们进一步提出一种基于复杂度的示例选择策略,通过少样本多模态上下文学习(MM-ICL)大幅增强其多步推理能力。在 MAD-eval 数据集上的实验结果表明,按标准评估指标衡量,MM-Narrator 在大多数场景下持续优于现有的基于微调的方法和基于 LLM 的方法。此外,我们引入了首个面向循环文本生成的基于片段的评估器。该评估器由 GPT-4 赋能,可全面推理并在多个可扩展维度上标注 AD 生成性能。

关键词

引用

@article{arxiv.2311.17435,
  title  = {MM-Narrator: Narrating Long-form Videos with Multimodal In-Context Learning},
  author = {Chaoyi Zhang and Kevin Lin and Zhengyuan Yang and Jianfeng Wang and Linjie Li and Chung-Ching Lin and Zicheng Liu and Lijuan Wang},
  journal= {arXiv preprint arXiv:2311.17435},
  year   = {2023}
}

备注

Project page at https://mm-narrator.github.io/