谎言能否被伪造?从机器学习视角比较低利害与高利害欺骗视频数据集
计算机视觉与模式识别
2023-08-22 v2 机器学习
摘要
尽管谎言在人类社会中影响巨大,且人类在欺骗检测(DD)上的准确率仅为可怜的54%,但由于数据稀缺,执行自动化DD的机器学习系统仍无法在真实场景中得到恰当应用。公开可用的DD数据集极少,而新数据集的创建受限于低利害与高利害谎言之间的概念区分。理论上,这两类谎言差异极大,以至于一种谎言的数据集无法用于另一种谎言的应用。尽管在低利害欺骗上获取数据更容易,因为它可在受控环境中被模拟(伪造),但这些谎言并不具备与真实高利害谎言同等的意义或深度,而后者难以获取且是自动化DD系统的实际关注点。为从实践角度探究这一区分是否成立,我们设计了若干实验,比较一个高利害DD数据集与一个低利害DD数据集,在仅基于视频数据工作的深度学习分类器上评估其结果。在我们的实验中,在低利害谎言上训练的网络对高利害欺骗的分类准确率高于对低利害谎言的准确率,尽管将低利害谎言作为高利害数据集的增强策略反而降低了其准确率。
引用
@article{arxiv.2211.13035,
title = {Can lies be faked? Comparing low-stakes and high-stakes deception video datasets from a Machine Learning perspective},
author = {Mateus Karvat Camara and Adriana Postal and Tomas Henrique Maul and Gustavo Paetzold},
journal= {arXiv preprint arXiv:2211.13035},
year = {2023}
}
备注
11 pages, 3 figures