COCONut-PanCap:面向细粒度理解与生成的联合全景分割与定位描述
计算机视觉与模式识别
2025-02-05 v1
摘要
本文介绍了 COCONut-PanCap 数据集,该数据集旨在增强全景分割和定位图像描述。该数据集基于 COCO 数据集和先进的 COCONut 全景掩码构建,旨在克服现有图像-文本数据集常缺乏详细、场景全面描述的局限性。COCONut-PanCap 数据集整合了基于全景分割掩码的细粒度、区域级描述,确保了一致性并提高了生成描述的细节程度。通过人工编辑、密集标注的描述,COCONut-PanCap 支持改进用于图像理解的视觉-语言模型(VLM)和用于文本到图像任务的生成模型的训练。实验结果表明,COCONut-PanCap 显著提升了理解和生成任务的性能,为大规模数据集提供了互补优势。该数据集为评估模型在联合全景分割与定位描述任务上的表现设立了新基准,满足了多模态学习中对高质量、详细图像-文本标注的需求。
引用
@article{arxiv.2502.02589,
title = {COCONut-PanCap: Joint Panoptic Segmentation and Grounded Captions for Fine-Grained Understanding and Generation},
author = {Xueqing Deng and Qihang Yu and Ali Athar and Chenglin Yang and Linjie Yang and Xiaojie Jin and Xiaohui Shen and Liang-Chieh Chen},
journal= {arXiv preprint arXiv:2502.02589},
year = {2025}
}
备注
project website: https://xdeng7.github.io/coconut.github.io/coconut_pancap.html