论语言引导在低级视觉任务中的鲁棒性:来自深度估计的发现
计算机视觉与模式识别
2024-04-15 v1
摘要
近年来,通过引入自然语言作为额外引导,单目深度估计取得了进展。尽管取得了令人瞩目的成果,但语言先验的影响,特别是在泛化能力和鲁棒性方面,仍未被探索。在本文中,我们通过量化这一先验的影响来填补这一空白,并引入方法以在各种设置下基准测试其有效性。我们生成传达以对象为中心的三维空间关系的“低级”句子,将其作为额外的语言先验纳入,并评估它们对深度估计的下游影响。我们的关键发现是,当前语言引导的深度估计器仅在场景级描述下表现最佳,反而与直觉相反,在低级描述下表现更差。尽管利用了额外数据,这些方法对定向对抗攻击并不鲁棒,并且性能随着分布偏移的增加而下降。最后,为了为未来研究提供基础,我们识别了失败点并提供了深入见解以更好地理解这些不足。随着越来越多使用语言进行深度估计的方法出现,我们的发现突出了在真实世界环境中有效部署时需要仔细考虑的机遇与陷阱。
引用
@article{arxiv.2404.08540,
title = {On the Robustness of Language Guidance for Low-Level Vision Tasks: Findings from Depth Estimation},
author = {Agneet Chatterjee and Tejas Gokhale and Chitta Baral and Yezhou Yang},
journal= {arXiv preprint arXiv:2404.08540},
year = {2024}
}
备注
Accepted to CVPR 2024. Project webpage: https://agneetchatterjee.com/robustness_depth_lang/