中文

人类与视觉语言模型:叙事连贯性的统一度量

计算与语言 2026-03-27 v1

摘要

我们通过比较人类撰写的叙事与视觉语言模型(VLMs)在Visual Writing Prompts语料库上生成的叙事,研究了视觉化故事中的叙事连贯性。使用一组捕捉叙事连贯性不同方面的指标,包括共指、话语关系类型、话题连续性、角色持续性和多模态角色锚定,我们计算了叙事连贯性评分。我们发现VLMs展现出与人类广泛相似但系统性不同的连贯性特征。此外,各项指标的差异通常细微,但当联合考虑时变得更加清晰。总体而言,我们的结果表明,尽管具有类人的表面流畅性,模型叙事在如何跨视觉化故事组织话语方面与人类叙事存在系统性差异。我们的代码可在 https://github.com/GU-CLASP/coherence-driven-humans 获取。

关键词

引用

@article{arxiv.2603.25537,
  title  = {Humans vs Vision-Language Models: A Unified Measure of Narrative Coherence},
  author = {Nikolai Ilinykh and Hyewon Jang and Shalom Lappin and Asad Sayeed and Sharid Loáiciga},
  journal= {arXiv preprint arXiv:2603.25537},
  year   = {2026}
}

备注

9 pages of content, 1 page of appendices, 9 tables, 3 figures