VEXA:面向诈骗风险感知的证据导向且人格化的解释
密码学与安全
2026-02-06 v1 计算与语言
机器学习
摘要
跨电子邮件、短消息服务和社交媒体的网络诈骗日益挑战日常风险评估,尤其是由于生成式 AI 使欺骗性语言更加流畅且更具情境感知能力。尽管基于转换器的检测器在预测性能方面取得良好成绩,但其解释往往对非专业用户而言不透明,或与模型决策不一致。我们提出 VEXA,一个证据导向且人格化的框架,用于生成面向学习者的诈骗解释,通过整合 GradientSHAP 基于证据的归因与理论感知的人格化方法。跨多通道数据集的评估显示,基于检测器派生证据的解释可在不增加语言复杂度的前提下提高语义可靠性,而人格化条件引入可解释的风格变异,同时不破坏证据一致性。这些结果揭示了一个关键设计洞察:证据导向主导语义正确性,而人格化适应性作用于呈现层面,且在忠诚性约束下运作。总体而言,VEXA 证明了人格化、证据导向解释的可行性,并为在非正式语境中构建可信赖、面向学习者的安全解释提供了设计指导。
引用
@article{arxiv.2602.05056,
title = {VEXA: Evidence-Grounded and Persona-Adaptive Explanations for Scam Risk Sensemaking},
author = {Heajun An and Connor Ng and Sandesh Sharma Dulal and Junghwan Kim and Jin-Hee Cho},
journal= {arXiv preprint arXiv:2602.05056},
year = {2026}
}