基于对比强化学习的视觉叙事中的实体重识别
计算机视觉与模式识别
2025-07-14 v2
摘要
视觉叙事系统,特别是大型视觉语言模型,在跨帧保持人物和物体身份方面存在挑战,往往无法识别不同图像中代表相同个体或物体的实体,导致引用不一致和指代幻觉。这种现象发生的原因是模型缺乏针对何时建立实体跨帧连接的显式训练。我们提出一种对比强化学习方法,通过训练模型区分连贯图像序列与来自无关图像的故事来学习合适的实体连接行为。我们将 Story Reasoning 数据集扩展引入合成负面样本,以教导模型建立恰当的实体连接。我们采用直接偏好优化(Direct Preference Optimization)并采用包含 grounding 和实体重识别双组成分的奖励函数,以促进真实故事中实体的 grounding 和重识别,同时惩罚合成情境中错误的实体连接。借助该对比框架,我们对 Qwen Storyteller(基于 Qwen2.5-VL 7B)进行微调。评估结果显示,grounding mAP 从 0.27 提升至 0.31(+14.8%),F1 从 0.35 提升至 0.41(+17.1%)。指代物 grounding 准确率在除 "its" 外的所有指代类型均有所提高,跨帧人物和物体持久性在所有帧数下均有提升,出现在 5 帧以上实体的比例从 29.3% 提升至 33.3%(+13.7%)。包含 chain-of-thought 与 grounding 故事的结构化故事比例从 79.1% 提升至 97.5%(+23.3%)。
引用
@article{arxiv.2507.07340,
title = {Entity Re-identification in Visual Storytelling via Contrastive Reinforcement Learning},
author = {Daniel A. P. Oliveira and David Martins de Matos},
journal= {arXiv preprint arXiv:2507.07340},
year = {2025}
}
备注
7 pages