中文

RelayFormer:面向可扩展图像与视频 manipulation localization 的统一局域-全局注意力框架

计算机视觉与模式识别 2025-10-06 v2 人工智能

摘要

视觉 manipulation localization(VML)旨在识别图像和视频中的篡改区域,该任务因高级编辑工具的兴起变得日益具有挑战性。现有方法面临两个主要问题:分辨率多样性,调整或填充会扭曲 forensic 痕迹并降低效率;以及模态鸿沟,图像和视频往往需要独立模型。为此,我们提出 RelayFormer,一个适应不同分辨率和模态的统一框架。RelayFormer 将输入划分为固定大小的子图像,引入 Global-Local Relay(GLR)token,通过全局-局域 relay attention(GLRA)机制传递结构化上下文。这实现了对全局线索(如语义或时间一致性)的高效交换,同时保留细粒度 manipulation 痕迹。不同于依赖统一缩放或稀疏注意力的先前方法,RelayFormer 可自然扩展至任意分辨率和视频序列,无需过度开销。跨多样化基准的实验表明,RelayFormer 在效率和性能之间实现最佳效果,兼具分辨率适应性(无插值或冗余填充)、图像与视频统一建模,以及准确性与计算成本之间的强平衡。代码已公开:https://github.com/WenOOI/RelayFormer。

关键词

引用

@article{arxiv.2508.09459,
  title  = {RelayFormer: A Unified Local-Global Attention Framework for Scalable Image and Video Manipulation Localization},
  author = {Wen Huang and Jiarui Yang and Tao Dai and Jiawei Li and Shaoxiong Zhan and Bin Wang and Shu-Tao Xia},
  journal= {arXiv preprint arXiv:2508.09459},
  year   = {2025}
}