LongWriter-V:在视觉语言模型中实现超长高保真生成
计算机视觉与模式识别
2025-02-21 v1 人工智能
计算与语言
摘要
现有的大型视觉语言模型 (LVLMs) 可处理最长达 128k 视觉和文本 token 的输入,但在生成超过 1000 单词的连贯输出方面仍存在挑战。我们发现,主要限制是监督微调 (SFT) 时缺乏长输出示例。为解决此问题,我们引入 LongWriter-V-22k,一个包含 22,158 个示例的数据集,每个示例包含多个输入图像、指令以及输出长度从 0 到 10,000 单词。此外,为实现保持高保真度的长输出,我们采用 Direct Preference Optimization (DPO) 对 SFT 模型进行优化。鉴于为获取 3000 单词级别的人类反馈成本高昂,我们提出 IterDPO,将长输出分割为片段并通过迭代纠正来构建偏好对。此外,我们开发了 MMLongBench-Write,一个包含六个任务的基准,用于评估 VLMs 的长文本生成能力。我们 7B 参数模型在 LongWriter-V-22k 和 IterDPO 训练后,在该基准上取得优异成绩,甚至超越了像 GPT-4o 这样的大型专有模型。代码与数据:https://github.com/THU-KEG/LongWriter-V
引用
@article{arxiv.2502.14834,
title = {LongWriter-V: Enabling Ultra-Long and High-Fidelity Generation in Vision-Language Models},
author = {Shangqing Tu and Yucheng Wang and Daniel Zhang-Li and Yushi Bai and Jifan Yu and Yuhao Wu and Lei Hou and Huiqin Liu and Zhiyuan Liu and Bin Xu and Juanzi Li},
journal= {arXiv preprint arXiv:2502.14834},
year = {2025}
}