从理想到现实:面向实际场景的统一且数据高效的稠密预测
计算机视觉与模式识别
2025-10-01 v2
摘要
稠密预测任务在计算机视觉中具有重要意义,旨在学习输入图像的像素级标注标签。尽管该领域取得了进展,现有方法主要聚焦于理想条件,表现出有限的现实泛化性,在实际场景中难以应对现实数据的严重稀缺。为系统性地研究此问题,我们首先引入 DenseWorld,这是一个涵盖25个稠密预测任务的基准数据集,这些任务对应于紧急的现实应用,具有跨任务的统一评估。随后我们提出 DenseDiT,通过统一策略利用生成模型的视觉先验来完成多样化的现实稠密预测任务。DenseDiT 结合参数复用机制和两个轻量级分支,适性地整合多尺度上下文。该设计使 DenseDiT 能够以少于0.1%的额外参数实现高效微调,激活视觉先验,同时有效适应多样化的现实稠密预测任务。在DenseWorld上的评估显示,现有通用和专用基线方法性能显著下降,凸显其在现实泛化上的局限性。相比之下,DenseDiT 使用的训练数据不足于基线方法的0.01%,实现了卓越的性能,彰显其在实际部署中的实用价值。
引用
@article{arxiv.2506.20279,
title = {From Ideal to Real: Unified and Data-Efficient Dense Prediction for Real-World Scenarios},
author = {Changliang Xia and Chengyou Jia and Zhuohang Dang and Minnan Luo and Zhihui Li and Xiaojun Chang},
journal= {arXiv preprint arXiv:2506.20279},
year = {2025}
}