中文

水下场景统一图像稠密标注生成模型

计算机视觉与模式识别 2025-07-29 v2

摘要

水下稠密预测,特别是深度估计和语义分割,对全面理解水下场景至关重要。然而,由于复杂的环境和高昂的数据收集成本,缺乏高质量且大规模的水下数据集,标注稠密。本文提出了一种统一的文本到图像和稠密标注生成方法(TIDE),用于水下场景。它仅依赖于文本输入,即可同时生成逼真的水下图像和多个高度一致的稠密标注。具体而言,我们将文本到图像和文本到稠密标注的生成统一到单个模型中。引入了隐式布局共享机制(ILS)和称为时间自适应归一化 (TAN) 的跨模态交互方法,以联合优化图像和稠密标注之间的一致性。我们使用 TIDE 生成大规模水下数据集,以验证其在水下稠密预测任务中的有效性。结果表明,该方法有效提高了现有水下稠密预测模型的性能,并缓解了水下稠密标注数据稀缺的问题。我们希望该方法为解决其他领域的数据稀缺问题提供新的视角。代码可在 https://github.com/HongkLin/TIDE 获取。

关键词

引用

@article{arxiv.2503.21771,
  title  = {A Unified Image-Dense Annotation Generation Model for Underwater Scenes},
  author = {Hongkai Lin and Dingkang Liang and Zhenghao Qi and Xiang Bai},
  journal= {arXiv preprint arXiv:2503.21771},
  year   = {2025}
}

备注

Accepted by CVPR 2025. The code is available at https://github.com/HongkLin/TIDE