中文

基于位置編碼時間注意力的變形自由跨域圖像註冊

计算机视觉与模式识别 2026-03-03 v2 人工智能

摘要

我們解決跨域圖像註冊問題,其中配對圖像呈現耦合的幾何錯位與域特定的外觀偏移。我們將其形式化為分解問題:將每張圖像分解為域無關場景表示與全局外觀統計,使得註冊簡化為通過自適應實例正規化 (AdaIN) 將移動圖像的場景結構與固定圖像的外觀重新組合。這種分解消除了對顯式變形場估計的需求。為了利用序列採集中的時間一致性,我們引入位置編碼的跨幀注意力機制,將可學習與正弦位置嵌入與在滑動窗口內的鄰近幀之間的多頭注意力相融合,豐富了場景表示中的跨幀情境。我們將此框架實例化為 GPEReg-Net,並在兩個基準上進行評估:FIRE-Reg-256(視網膀底圖,半剛性)和 HPatches-Reg-256(合成文本紋理裂片,仿射變形)。GPEReg-Net 在兩個基準上實現了狀態-of-the-art 性能(FIRE:SSIM = 0.928,PSNR = 33.47 dB;HPatches:SSIM = 0.450,PSNR = 21.01 dB),超越所有基線,包括變形方法,同時比 SAS-Net 快 1.87 倍。

关键词

引用

@article{arxiv.2602.15959,
  title  = {Deformation-Free Cross-Domain Image Registration via Position-Encoded Temporal Attention},
  author = {Yiwen Wang and Jiahao Qin},
  journal= {arXiv preprint arXiv:2602.15959},
  year   = {2026}
}

备注

11 pages, 3 figures