中文

无训练的空间导向几何形状编码

计算机视觉与模式识别 2026-05-12 v2

摘要

位置编码已成为将深度神经网络锚定在离散点位位置上的事实标准,已在以一维序列表示为输入的任务中取得显著成功。然而,将这一概念扩展到二维空间几何形状,需要仔细设计编码策略,不仅要考虑形状几何和姿态,还要确保与神经网络学习的兼容性。本文通过引入一种训练-free 的通用编码策略,称为 XShapeEnc,将任意空间导向的二维几何形状编码为紧凑表示,具备五大有利属性,包括可逆性、适应性和频率丰富性。具体而言,将二维空间导向几何形状分解为单位圆盘内的归一化几何和姿态向量,其中姿态进一步转换为位于单位圆盘内的谐波姿态场。构建一组正交的 Zernike 基,以独立或联合方式编码形状几何和姿态,随后进行频率传播运算以引入高频内容。我们通过广泛的形状感知任务和自建的 XShapeCorpus 数据集,展示了 XShapeEnc 在理论有效性、效率、可区分性和适用性方面的分析与实验。我们设想 XShapeEnc 作为超越一维序列数据的前沿二维空间智能研究的基石工具。

关键词

引用

@article{arxiv.2604.07522,
  title  = {Training-free Spatially Grounded Geometric Shape Encoding (Technical Report)},
  author = {Yuhang He},
  journal= {arXiv preprint arXiv:2604.07522},
  year   = {2026}
}

备注

Training-Free 2D Geometric Shape Encoding