VLHSA:面向侵蚀间隙拼图求解的视觉-语言层次语义对齐
机器学习
2025-10-01 v1
摘要
拼图求解在计算机视觉中仍然具有挑战性,需要理解局部碎片细节和全局空间关系。虽然大多数传统方法仅关注边缘匹配和视觉连贯性等视觉线索,但很少有方法探索在具有挑战性的场景中利用自然语言描述进行语义引导,特别是对于侵蚀间隙拼图。我们提出了一个视觉-语言框架,利用文本上下文来增强拼图组装性能。我们的方法以视觉-语言层次语义对齐(VLHSA)模块为核心,该模块通过从局部 token 到全局上下文的多级语义匹配,将视觉图块与文本描述进行对齐。此外,该模块还集成了一个结合双视觉编码器与语言特征以进行跨模态推理的多模态架构。实验表明,我们的方法在多个数据集上显著优于 SOTA 模型,取得了实质性提升,包括在拼块准确率上提高了 14.2 个百分点。消融研究证实了 VLHSA 模块在驱动超越纯视觉方法改进中的关键作用。我们的工作通过融入多模态语义见解,为拼图求解确立了新的范式。
引用
@article{arxiv.2509.25202,
title = {VLHSA: Vision-Language Hierarchical Semantic Alignment for Jigsaw Puzzle Solving with Eroded Gaps},
author = {Zhuoning Xu and Xinyan Liu},
journal= {arXiv preprint arXiv:2509.25202},
year = {2025}
}