HCNQA:用于增强3D VQA的层次化集中缩小监督
计算机视觉与模式识别
2025-07-03 v1 多媒体
摘要
3D视觉问答(3D VQA)是模型 perceive 物理世界并执行空间推理的关键任务。答案中心监督是3D VQA模型常用的训练方法。许多利用此策略的方法在3D VQA任务中取得了令人期待的结果。然而,答案中心方法仅监督模型的最终输出,允许模型自由发展推理路径。推理路径缺乏监督会导致模型通过问题-答案对中常见模式开发浅层捷径的潜在可能性。此外,尽管慢思考方法推进大型语言模型,但它们 suffers from underthinking。为此,我们提出HCNQA,一种基于层次化集中缩小监督方法的3D VQA模型。通过模仿人类从广泛区域逐渐聚焦于特定对象以搜索答案的过程,我们的方法通过层次化监督引导模型完成三个浓度缩小阶段。通过对一般推理路径上的关键检查点进行监督,该方法可确保开发出合理且有效的推理路径。大量实验结果表明,该方法能够有效确保模型开发出合理的推理路径并取得更好性能。代码可在https://github.com/JianuoZhu/HCNQA 获取。
引用
@article{arxiv.2507.01800,
title = {HCNQA: Enhancing 3D VQA with Hierarchical Concentration Narrowing Supervision},
author = {Shengli Zhou and Jianuo Zhu and Qilin Huang and Fangjing Wang and Yanfu Zhang and Feng Zheng},
journal= {arXiv preprint arXiv:2507.01800},
year = {2025}
}
备注
ICANN 2025