SynRES:通过合成数据实现野生环境下的指代表达分割
机器学习
2025-05-26 v1 人工智能
计算机视觉与模式识别
摘要
尽管指代表达分割(RES)基准在不断进步,但其评估协议仍受限,主要聚焦于单目标、包含最小属性的短查询,或单一域内来自不同查询的多个目标。这一限制显著阻碍了对更复杂推理能力的评估。我们引入 WildRES,一个新型基准,包含长查询、多样化属性以及非明确区分的多个目标查询。该基准涵盖自主驾驶环境和机器人操作场景等多样化应用域,从而更严密地评估了在真实世界环境中复杂推理能力。我们的分析表明,当前 RES 模型在 WildRES 上的表现显著下降。为解决这一挑战,我们提出 SynRES,一个自动化管道,通过三项创新措施生成密集的组合合成训练数据:(1) 基于密集描述的合成,用于属性丰富的图像-掩码-表达式三元组;(2) 可靠的语义对齐机制通过图像-文本对齐分组纠正描述-伪掩码不一致性;(3) 领域感知的增强,融合马赛克组成和超类替换,以强调泛化能力和区分属性而非物体类别。实验结果表明,采用 SynRES 训练的模型在 WildRES-ID 上实现 gIoU 提升 2.0%,在 WildRES-DS 上实现 gIoU 提升 3.8%。代码和数据集已公开于 https://github.com/UTLLab/SynRES。
引用
@article{arxiv.2505.17695,
title = {SynRES: Towards Referring Expression Segmentation in the Wild via Synthetic Data},
author = {Dong-Hee Kim and Hyunjee Song and Donghyun Kim},
journal= {arXiv preprint arXiv:2505.17695},
year = {2025}
}