中文

面向视觉语言模型的生成式自然叙事基准:SPoRC-VIST

机器学习 2026-01-06 v1 人工智能 计算机视觉与模式识别

摘要

视觉语言模型(VLMs)在描述性任务(如图像字幕和视觉问答)方面取得了显著的成功。然而,它们在生成引人入胜的长篇叙事—— Specifically 指的是多说话人播客对话——方面的能力仍未得到充分探索且难以评估。标准指标如 BLEU 和 ROUGE 无法捕捉对话自然性、人格性和叙事流畅性的细微差异,往往会奖励安全、重复的输出,而非引人入胜的叙事。本文提出了一条用于端到端视觉播客生成的新型管道,并在由 4000 组图像-对话对组成的精选数据集上对 Qwen3-VL-32B 模型进行微调。关键在于我们采用了从合成到真实的训练策略:我们在来自结构化播客研究语料库(SPoRC)与合成生成图像配对的高质量播客对话上进行训练,在来自视觉叙事数据集(VIST)的真实世界照片序列上进行评估。这一严格的设置测试了模型从合成训练数据到真实世界视觉领域的泛化能力。我们提出了全面的评估框架,超越文本重叠,并使用 AI 评判(Gemini 3 Pro、Claude Opus 4.5、GPT 5.2)和新颖的风格指标(平均轮次长度、说话人切换频率)来评估质量。我们的实验表明,微调后的 32B 模型在对话自然性(>80% 获胜率)和叙事深度(+50% 轮次长度)方面显著优于 235B 基础模型,同时保持相同的视觉 grounding 能力(CLIPScore: 20.39)。

关键词

引用

@article{arxiv.2601.01062,
  title  = {SPoRC-VIST: A Benchmark for Evaluating Generative Natural Narrative in Vision-Language Models},
  author = {Yunlin Zeng},
  journal= {arXiv preprint arXiv:2601.01062},
  year   = {2026}
}

备注

14 pages, 3 figures. Accepted to WVAQ 2026, WACV 2026