面向零样本差分面部化学攻击检测的多模态大语言模型
计算机视觉与模式识别
2025-05-22 v1
摘要
利用多模态大语言模型 (LLM) 的强大能力为增强面部化学攻击检测 (MAD) 的准确性和可解释性提供了可行路径,尤其是在实际生物识别应用中。本工作引入了 LLM 用于差分面部化学攻击检测 (D-MAD)。据我们所知,这是首次使用多模态 LLM 对 D-MAD 进行实证数据测试。为有效利用这些模型,我们设计了基于链式思维 (Chain-of-Thought, CoT) 的提示词,以降低未能回答率并增强决策推理。我们的贡献包括:(1) 首次应用多模态 LLM 使用真实数据主体进行 D-MAD;(2) 基于 CoT 的提示工程以提高响应可靠性和可解释性;(3) 使用来自 54 名个体的人脸录入场景数据,对 LLM 性能进行全面的定性和定量基准测试;(4) 对两种多模态 LLM:ChatGPT-4o 和 Gemini 进行比较分析,提供关于其面部化学攻击检测准确性和决策透明度的见解。实验结果表明,ChatGPT-4o 在检测准确性方面优于 Gemini,尤其是在针对基于生成对抗网络 (GAN) 的化学攻击时,尽管两种模型在挑战条件下都表现不佳。虽然 Gemini 提供了更一致的解释,但 ChatGPT-4o 更具韧性,但可能存在更高的未能回答率。
引用
@article{arxiv.2505.15332,
title = {Towards Zero-Shot Differential Morphing Attack Detection with Multimodal Large Language Models},
author = {Ria Shekhawat and Hailin Li and Raghavendra Ramachandra and Sushma Venkatesh},
journal= {arXiv preprint arXiv:2505.15332},
year = {2025}
}
备注
Accepted at IEEE International Conference on Automatic Face and Gesture Recognition (FG 2025)