中文

基于迭代故事感知描述与大型语言模型的相册讲故事

计算机视觉与模式识别 2023-05-25 v2

摘要

本工作研究如何将相册转化为生动且连贯的故事,我们称该任务为“相册讲故事”。尽管此任务有助于保存记忆并促进经验分享,它在现有文献中仍属未被充分探索的领域。随着大型语言模型(LLMs)的近期进展,生成冗长、连贯的文本已成为可能,为开发相册讲故事的AI助手提供了机遇。一种自然的方法是使用描述模型描述相册中每张照片,然后利用LLMs将生成的描述总结并重写为引人入胜的故事。然而,我们发现这常导致故事包含与图像矛盾的幻觉信息,因为每张生成的描述(“故事无关”)并不总是关于与整个故事相关的描述或遗漏了某些必要信息。为应对这些局限,我们提出了一种新的迭代相册讲故事流程。具体而言,我们以初始故事开始,并构建故事感知描述模型,以整个故事为引导来精炼描述。精炼后的描述随后被输入LLMs以生成新的精炼故事。该过程迭代重复,直至故事在保持连贯的同时包含极小的 factual 错误。为评估我们提出的流程,我们引入了一个来自vlogs的图像集合新数据集以及一套系统评估度量。我们的结果表明,我们的方法能为相册有效生成更准确且引人入胜的故事,并增强了连贯性与生动性。

关键词

引用

@article{arxiv.2305.12943,
  title  = {Album Storytelling with Iterative Story-aware Captioning and Large Language Models},
  author = {Munan Ning and Yujia Xie and Dongdong Chen and Zeyin Song and Lu Yuan and Yonghong Tian and Qixiang Ye and Li Yuan},
  journal= {arXiv preprint arXiv:2305.12943},
  year   = {2023}
}