DiscoSG:通过迭代图细化实现话语级文本场景图解析
计算与语言
2025-10-27 v3
摘要
视觉语言模型(VLMs)生成话语级的多句子视觉描述,这对针对单句子caption-to-graph映射构建的文本场景图解析器构成挑战。当前方法通常合并句子级解析输出以处理话语输入,常缺失跨句子指代现象,导致图碎片化并影响下游VLM任务性能。我们提出新任务——话语级文本场景图解析(DiscoSG),并发布DiscoSG-DS数据集,包含400个专业标注及8430个合成的多句子caption-graph对。每段平均9句,图中三元组数是现有数据集的3倍。以DiscoSG-DS微调GPT-4o后,SPICE指标比最佳句子合并基线高超过40%。然而其高推理成本和授权限制开源使用。较小的微调开源模型(如Flan-T5)在简单图上表现良好,但在稠密复杂图上性能下降。为弥合差距,我们引入DiscoSG-Refiner——轻量级开源解析器,通过草拟种子图并迭代细化新构建的学习图编辑模型,实现比基线高30%的SPICE,同时比GPT-4o快86倍。其从简单到稠密图均能一致提升下游VLM任务,包括话语级caption评估与幻觉检测,超越替代开源解析器。代码与数据已公开于https://github.com/ShaoqLin/DiscoSG。
引用
@article{arxiv.2506.15583,
title = {DiscoSG: Towards Discourse-Level Text Scene Graph Parsing through Iterative Graph Refinement},
author = {Shaoqing Lin and Chong Teng and Fei Li and Donghong Ji and Lizhen Qu and Zhuang Li},
journal= {arXiv preprint arXiv:2506.15583},
year = {2025}
}
备注
EMNLP 2025 (oral), 26 pages