PhraseStereo:首个开放词汇立体图像分割数据集
计算机视觉与模式识别
2025-10-02 v1
摘要
理解自然语言短语如何对应图像中特定区域是多模态语义分割中的关键挑战。最近的短语 grounding 进展在很大程度上仅限于单视图图像,忽略了立体视觉中可获得的丰富几何线索。为此,我们引入PhraseStereo,这是第一个将短语-区域分割引入立体图像对的新型数据集。PhraseStereo基于PhraseCut数据集,通过利用GenStereo生成准确的右视图图像,从而将现有的单视图数据扩展到立体领域。这种新设置为多模态学习引入独特的挑战和机遇,尤其是在利用深度线索实现更精确和上下文感知的 grounding 方面。通过提供具有对齐分割掩码和短语注释的立体图像对,PhraseStereo为未来在语言、视觉和3D感知交叉领域的研究奠定了基础,鼓励开发能够在语义和几何方面进行联合推理的模型。PhraseStereo数据集将在本工作接受后发布。
引用
@article{arxiv.2510.00818,
title = {PhraseStereo: The First Open-Vocabulary Stereo Image Segmentation Dataset},
author = {Thomas Campagnolo and Ezio Malis and Philippe Martinet and Gaetan Bahl},
journal= {arXiv preprint arXiv:2510.00818},
year = {2025}
}
备注
Accepted to X-Sense Ego-Exo Sensing for Smart Mobility Workshop at ICCV 2025 Conference