UrbanAlign:面向 VLM-人类偏好对齐的后置语义校准
计算机视觉与模式识别
2026-03-12 v4
摘要
视觉语言模型(VLM)能够详尽地描述城市场景,但在如安全评估和审美评估等特定领域任务中,却难以产生可靠的人类偏好标签。标准做法是通过微调或 RLHF(Reinforcement Learning from Human Feedback),但需要大规模标注并重新训练模型。我们提出不同问题:是否可以不修改任何权重的情况下,将冻结的 VLM 对齐到人类偏好?我们的关键洞察是:VLM 是强大的概念提取器,但却是差的决策校准器。我们提出了一个三阶段后置管线,利用这种非对称性:(i)自动从共识示例中挖掘可解释的评估维度;(ii)Observer-Debater-Judge 链从冻结的 VLM 中提取稳健的概念得分;(iii)在混合流形上进行局部加权岭回归,将这些得分校准到人类评分。应用于 Place Pulse 2.0 上的 UrbanAlign 框架,在六个感知类别上达到 72.2% 的准确率(kappa=0.45),超越所有基线提升 +11.0 pp,零样本 VLM 提升 +15.5 pp,同时保持完全可解释性和零权重修改。
关键词
引用
@article{arxiv.2602.19442,
title = {UrbanAlign: Post-hoc Semantic Calibration for VLM-Human Preference Alignment},
author = {Yecheng Zhang and Rong Zhao and Zhizhou Sha and Yong Li and Lei Wang and Ce Hou and Wen Ji and Hao Huang and Yunshan Wan and Jian Yu and Junhao Xia and Yuru Zhang and Chunlei Shi},
journal= {arXiv preprint arXiv:2602.19442},
year = {2026}
}
备注
26 pages