Wild 中的尺子读取
计算机视觉与模式识别
2025-07-10 v1
摘要
准确地将像素测量值转换为绝对的真实世界尺寸是计算机视觉中的一个基本挑战,限制了生物医学、法医、营养分析和电子商务等关键应用的进展。我们提出了 RulerNet,一个能够在野外环境中稳健推断尺度的深度学习框架,通过将尺子读取问题重新表述为统一的关键点检测问题,并使用对视角变换不变的几何级数参数来表示尺子。与依赖手工阈值或刚性、尺子特定管道的传统方法不同,RulerNet 通过一种抗扭曲的标注和训练策略,直接定位厘米标记,能够在多样化的尺子类型和图像条件下实现强大的泛化,同时缓解数据稀缺问题。我们还提出了可扩展的合成数据管道,将基于图形的尺子生成与 ControlNet 结合,以添加照片级的背景,大大增加了训练的多样性并提高了性能。为了进一步增强鲁棒性和效率,我们提出了 DeepGP,一个轻量级前馈网络,从噪声标记中回归几何级数参数,消除了迭代优化,使其能够在移动或边缘设备上实现实时尺度估计。实验表明,RulerNet 在面临挑战的真实世界条件下能够提供准确、一致且高效的尺度估计。这些结果凸显了其作为通用可测量工具的实用性,以及其在高影响力领域的自动化、尺度感知分析中与其他视觉组件集成的潜力。演示地址:https://huggingface.co/spaces/ymp5078/RulerNet-Demo
引用
@article{arxiv.2507.07077,
title = {Reading a Ruler in the Wild},
author = {Yimu Pan and Manas Mehta and Gwen Sincerbeaux and Jeffery A. Goldstein and Alison D. Gernand and James Z. Wang},
journal= {arXiv preprint arXiv:2507.07077},
year = {2025}
}