面向事件归因的两阶段前缀增强多模态大语言模型
计算与语言
2024-09-17 v1
摘要
社交媒体平台对语义丰富服务的需求日益迫切,例如事件归因和故事线分析。然而,现有研究大多集中于片段级事件理解,主要通过基础字幕生成任务实现,缺乏对整部电影中事件因果关系的分析。这是一个重大挑战,因为即使是先进的多模态大语言模型(MLLM)也会因上下文长度有限而难以处理海量的多模态信息。为解决这一问题,我们提出了一种用于事件归因的两阶段前缀增强多模态大语言模型(TSPE)方法,即在电影视频中将相关事件与其因果语义联系起来。在局部阶段,我们引入了一种交互感知前缀,引导模型关注单个片段内的相关多模态信息,并简要概括该单一事件。相应地,在全局阶段,我们利用推理知识图谱加强相关事件之间的联系,并设计了一种事件感知前缀,引导模型关注相关事件而非所有先前片段,从而实现准确的事件归因。对两个真实世界数据集的综合评估表明,我们的框架优于现有最先进的方法。
关键词
引用
@article{arxiv.2409.09362,
title = {Generating Event-oriented Attribution for Movies via Two-Stage Prefix-Enhanced Multimodal LLM},
author = {Yuanjie Lyu and Tong Xu and Zihan Niu and Bo Peng and Jing Ke and Enhong Chen},
journal= {arXiv preprint arXiv:2409.09362},
year = {2024}
}