跨域音视频欺骗检测基准测试
声音
2025-07-25 v3 计算机视觉与模式识别
多媒体
音频与语音处理
摘要
自动化欺骗检测对于帮助人类准确评估真实性并识别欺骗行为至关重要。传统的基于接触的技术,如测谎仪器,依赖生理信号来判断个体陈述的真实性。尽管近期发展表明,从音频和视频模态中提取的多模态特征可能在公开数据集上超越人类观察者,但现有音视频欺骗检测方法在不同情景下的跨域泛化性尚未得到充分探索。为填补这一空白,本文提出了首个跨域音视频欺骗检测基准测试,使我们能够评估这些方法在实际场景中的泛化性能。我们采用广泛使用的音频和视觉特征,以及不同的网络架构进行基准测试,比较了单域到单域和多域到单域的域泛化性能。为进一步利用多个源域数据进行训练,我们研究了三种域采样策略,包括域同步、域交替和域逐域,以进行多域到单域泛化评估。我们还提出了一种算法,通过最大化模态编码器之间的梯度内积来增强泛化性能,命名为“MM-IDGM”。此外,我们提出了注意力混合(Attention-Mixer)融合方法以提升性能,我们相信这个新的跨域基准将促进音视频欺骗检测领域的后续研究。
引用
@article{arxiv.2405.06995,
title = {Benchmarking Cross-Domain Audio-Visual Deception Detection},
author = {Xiaobao Guo and Zitong Yu and Nithish Muthuchamy Selvaraj and Bingquan Shen and Adams Wai-Kin Kong and Alex C. Kot},
journal= {arXiv preprint arXiv:2405.06995},
year = {2025}
}
备注
15 pages