FACTUAL:面向忠实且一致文本场景图解析的基准
计算与语言
2023-06-02 v2
摘要
文本场景图解析在包括图像字幕评价与图像检索在内的多种视觉-语言应用中变得日益重要。然而,现有将图像字幕转换为场景图的场景图解析器常受两类错误困扰。首先,生成的场景图未能捕捉字幕或相应图像的真实语义,导致缺乏忠实性。其次,生成的场景图一致性差,相同语义由不同标注表示。为应对这些挑战,我们提出一个新数据集,其通过使用称为 FACTUAL-MR 的新中间表示重新标注 Visual Genome(VG)中的字幕。FACTUAL-MR 可直接转换为忠实且一致的场景图标注。我们的实验结果清晰表明,在我们数据集上训练的解析器在忠实性与一致性上优于现有方法。该改进在图像字幕评价与零样本图像检索任务中均带来显著性能提升。此外,我们引入一种衡量场景图相似度的新度量,其与改进的场景图解析器结合,在上述任务多个基准数据集上取得最先进(SOTA)结果。代码与数据集见于 https://github.com/zhuang-li/FACTUAL 。
引用
@article{arxiv.2305.17497,
title = {FACTUAL: A Benchmark for Faithful and Consistent Textual Scene Graph Parsing},
author = {Zhuang Li and Yuyang Chai and Terry Yue Zhuo and Lizhen Qu and Gholamreza Haffari and Fei Li and Donghong Ji and Quan Hung Tran},
journal= {arXiv preprint arXiv:2305.17497},
year = {2023}
}
备注
9 pages, ACL 2023 (findings)