视频中音视频场景分类用于检测差异:基线方法与实验协议
计算机视觉与模式识别
2024-05-02 v1 多媒体
声音
音频与语音处理
摘要
本文提出了一种基线方法和实验协议,用于解决特定的内容验证问题:检测多媒体内容中音频与视频模态之间的差异。我们首先设计并优化一个音视频场景分类器,以与现有的使用两种模态的分类基线进行比较。随后,通过分别对音频和视觉模态应用该分类器,可以检测两者之间的场景类别不一致。为便于进一步的研究并提供常见的评估平台,我们引入了实验协议和模拟此类不一致性的基准数据集。我们的方法在场景分类方面实现了最先进的结果,并在音视频差异检测方面取得有前景的成果,凸显了其在内容验证应用中的潜力。
引用
@article{arxiv.2405.00384,
title = {Visual and audio scene classification for detecting discrepancies in video: a baseline method and experimental protocol},
author = {Konstantinos Apostolidis and Jakob Abesser and Luca Cuccovillo and Vasileios Mezaris},
journal= {arXiv preprint arXiv:2405.00384},
year = {2024}
}
备注
Accepted for publication, 3rd ACM Int. Workshop on Multimedia AI against Disinformation (MAD'24) at ACM ICMR'24, June 10, 2024, Phuket, Thailand. This is the "accepted version"