针对目标对齐的言语欺骗检测有效造假
计算与语言
2025-06-03 v2 人工智能
摘要
背景:通过分析语言进行欺骗检测是一种有前景的做法,既可使用人类判断也可使用自动机器学习判断。对于这两种形式的可信度评估,自动化针对欺骗陈述进行改写以使其看起来像诚实的自动化对抗攻击构成严重威胁。方法:我们使用包含243个诚实陈述和262个编造 autobiographical故事的数据集进行欺骗检测任务,用于人类和机器学习模型。在研究1中,人类对原文或对抗修改后的欺骗陈述进行欺骗判断或使用详细性启发法,以及两个机器学习模型(微调语言模型和简单n-gram模型)进行判断。在研究2中,我们操纵了修改的目标对齐方式,即将攻击量身定制用于人类还是计算机模型的评估。在结果中,当对抗修改与其目标对齐时,人类(d=-0.07和d=-0.04)和机器学习判断(51%准确率)均降至随机水平。当攻击未与目标对齐时,人类启发法判断(d=0.30和d=0.36)和机器学习预测(63-78%)均显著优于随机。结论:易于获取的语言模型能够有效帮助任何人伪造欺骗检测 efforts,不仅面向人类,也面向机器学习模型。对人类和机器的抗对抗修改鲁棒性取决于该目标对齐。我们闭于建议,以对抗攻击设计和技术推进欺骗研究。
引用
@article{arxiv.2501.05962,
title = {Effective faking of verbal deception detection with target-aligned adversarial attacks},
author = {Bennett Kleinberg and Riccardo Loconte and Bruno Verschuere},
journal= {arXiv preprint arXiv:2501.05962},
year = {2025}
}
备注
Accepted to Legal and Criminological Psychology (author version)