基于正负未标记学习方法的文化存储库媒体克隆检测
计算机视觉与模式识别
2026-04-07 v1
摘要
我们将 AtticPOT 存储库中的策馆式重复发现问题形式化为正负未标记学习 (PU) 问题。给定每个作品的单个锚点,我们在锚点的增强视图上训练一个轻量级 per-query 克隆编码器,并对未标记的存储库进行打分,以对抗性阈值对潜在 L2 范数进行评分。系统为策馆验证提出候选人,发现先前未验证的跨记录克隆。在 CIFAR-10 上我们取得 F1=96.37 (AUROC=97.97);在 AtticPOT 上我们达到 F1=90.79 (AUROC=98.99),在相同轻量级主干网络下显著优于最佳基线 (SVDD) 提高了 +7.70 分。定性 "find-similar" 面板在视点和条件之间显示稳定的邻域。该方法避免显式负样本,提供透明的运行点,并适用于去重、记录链接以及策馆式循环工作流程。
引用
@article{arxiv.2604.04071,
title = {Detecting Media Clones in Cultural Repositories Using a Positive Unlabeled Learning Approach},
author = {V. Sevetlidis and V. Arampatzakis and M. Karta and I. Mourthos and D. Tsiafaki and G. Pavlidis},
journal= {arXiv preprint arXiv:2604.04071},
year = {2026}
}
备注
Accepted at CAA 2026 International Conference