基于特征解耦与互信息最大化的视频侵权检测
计算机视觉与模式识别
2023-09-14 v1 多媒体
摘要
自媒体时代为我们提供了海量的高质量视频。遗憾的是,频发的视频版权侵权正严重损害视频创作者的利益与热情。因此,识别侵权视频是一项紧迫的任务。当前最先进的方法倾向于将高维混合视频特征直接输入深度神经网络,并依赖网络提取有用表征。尽管简单,该范式严重依赖原始纠缠特征,且缺乏约束以保证从特征中提取出有用的任务相关语义。本文从两方面应对上述挑战:(1) 我们提出将原始高维特征解耦为多个子特征,显式地将特征分解为互斥的低维分量。我们期望子特征编码原始特征中互不重叠的语义并去除冗余信息。(2) 在解耦子特征之上,我们进一步学习一个辅助特征以增强子特征。我们从理论上分析了标签与解耦特征之间的互信息,得到了一个从原始特征中最大化提取任务相关信息的损失。在两个大规模基准数据集(即 SVD 和 VCSL)上的大量实验表明,我们的方法在大规模 SVD 数据集上取得了 90.1% 的 TOP-100 mAP,并在 VCSL 基准数据集上刷新了当前最优(SOTA)成绩。我们的代码与模型已发布于 https://github.com/yyyooooo/DMI/,希望为社区做出贡献。
引用
@article{arxiv.2309.06877,
title = {Video Infringement Detection via Feature Disentanglement and Mutual Information Maximization},
author = {Zhenguang Liu and Xinyang Yu and Ruili Wang and Shuai Ye and Zhe Ma and Jianfeng Dong and Sifeng He and Feng Qian and Xiaobo Zhang and Roger Zimmermann and Lei Yang},
journal= {arXiv preprint arXiv:2309.06877},
year = {2023}
}
备注
This paper is accepted by ACM MM 2023