中文

视频中音视频场景分类用于检测差异:基线方法与实验协议

计算机视觉与模式识别 2024-05-02 v1 多媒体 声音 音频与语音处理

摘要

本文提出了一种基线方法和实验协议,用于解决特定的内容验证问题:检测多媒体内容中音频与视频模态之间的差异。我们首先设计并优化一个音视频场景分类器,以与现有的使用两种模态的分类基线进行比较。随后,通过分别对音频和视觉模态应用该分类器,可以检测两者之间的场景类别不一致。为便于进一步的研究并提供常见的评估平台,我们引入了实验协议和模拟此类不一致性的基准数据集。我们的方法在场景分类方面实现了最先进的结果,并在音视频差异检测方面取得有前景的成果,凸显了其在内容验证应用中的潜力。

关键词

引用

@article{arxiv.2405.00384,
  title  = {Visual and audio scene classification for detecting discrepancies in video: a baseline method and experimental protocol},
  author = {Konstantinos Apostolidis and Jakob Abesser and Luca Cuccovillo and Vasileios Mezaris},
  journal= {arXiv preprint arXiv:2405.00384},
  year   = {2024}
}

备注

Accepted for publication, 3rd ACM Int. Workshop on Multimedia AI against Disinformation (MAD'24) at ACM ICMR'24, June 10, 2024, Phuket, Thailand. This is the "accepted version"