面向字符核心指代的视觉故事生成
计算与语言
2025-03-04 v2 人工智能
摘要
角色在叙事中至关重要。它们推动情节进展,建立情感联系,并体现故事的主题。视觉叙事方法更关注与之相关的情节和事件,而不围绕特定角色构建叙事。因此,生成的故事显得笼统,角色提及缺失、模糊或不正确。为缓解此问题,本文引入字符中心化故事生成的新任务,并提出首个能够预测具有一致且核心指代字符提及的视觉故事的模型。我们的模型在我们构建的新数据集上进行微调,该数据集基于广泛使用的 VIST 基准。具体而言,我们开发了一个自动化管道,将视觉和文本字符核心指代链 enrich 到 VIST。我们还提出新的评估指标来衡量故事中角色的丰富性和核心指代。实验结果表明,我们的模型生成的故事在角色重复性和核心指代方面优于基线方法和最新系统。
引用
@article{arxiv.2409.13555,
title = {Generating Visual Stories with Grounded and Coreferent Characters},
author = {Danyang Liu and Mirella Lapata and Frank Keller},
journal= {arXiv preprint arXiv:2409.13555},
year = {2025}
}