音视欺骗检测:DOLOS数据集与参数高效跨模态学习
计算机视觉与模式识别
2023-08-07 v2 人工智能
摘要
对话中的欺骗检测是一项具有挑战性却十分重要的任务,在商业信誉评估、多媒体反欺诈和海关安全等诸多领域有关键应用。尽管如此,欺骗检测研究受限于高质量欺骗数据集的缺乏,以及有效学习多模态特征的困难。为解决此问题,我们引入了DOLOS\footnote{“DOLOS”一名源于希腊神话。},这是最大的带有丰富欺骗性对话的综艺节目欺骗检测数据集。DOLOS包含1,675个视频片段,涉及213名受试者,并已标注音视特征注释。我们提供训练-测试、时长和性别协议以探究不同因素的影响。我们在先前提出的欺骗检测方法上对我们的数据集进行基准测试。为通过微调更少参数进一步提升性能,我们提出参数高效跨模态学习(PECL),其中均匀时间适配器(UT-Adapter)在基于transformer的架构中探索时间注意力,而跨模态融合模块即插入式音视融合(PAVF)结合来自音视特征的跨模态信息。基于DOLOS上丰富的细粒度音视注释,我们还利用多任务学习通过同时预测欺骗与音视特征来增强性能。实验结果证明了DOLOS数据集的所需质量以及PECL的有效性。DOLOS数据集与源代码见 https://github.com/NMS05/Audio-Visual-Deception-Detection-DOLOS-Dataset-and-Parameter-Efficient-Crossmodal-Learning/tree/main。
引用
@article{arxiv.2303.12745,
title = {Audio-Visual Deception Detection: DOLOS Dataset and Parameter-Efficient Crossmodal Learning},
author = {Xiaobao Guo and Nithish Muthuchamy Selvaraj and Zitong Yu and Adams Wai-Kin Kong and Bingquan Shen and Alex Kot},
journal= {arXiv preprint arXiv:2303.12745},
year = {2023}
}
备注
11 pages, 6 figures