中文

面向网络欺骗的上下文图表生成

机器学习 2024-04-09 v1 人工智能 密码学与安全

摘要

蜜罐文件是安全资产,旨在吸引和检测受损系统上的入侵者。蜜罐文件是一种蜜罐,模仿真实的敏感文档,制造存在有价值数据的假象。与蜜罐文件的交互揭示了入侵者的存在,并可以提供对其目标和意图的洞察。然而,它们的实际使用受到手动创建真实内容所需的时间、成本和精力的限制。大型语言模型的引入使得高质量文本生成变得容易,但蜜罐文件包含各种内容,包括图表、表格和图像。这些内容需要合理且真实,并且在蜜罐文件内部以及与它们模仿的真实文档之间语义一致,才能成功欺骗入侵者。在本文中,我们专注于蜜罐文件内容生成问题的一个重要组成部分:文档图表。图表在企业文档中无处不在,常用于传达定量和科学数据。现有的图像生成模型,如DALL-E,很容易生成带有难以理解的文本和不可信数据的图表。我们采用多模态方法解决这个问题,结合了两个专门构建的生成模型:一个多任务Transformer和一个专门的多头自编码器。Transformer生成真实的标题和绘图文本,而自编码器生成绘图的基础表格数据。为了推动自动蜜罐图表生成领域的发展,我们还发布了一个新的文档图表数据集,并提出了一种新的度量标准——关键词语义匹配(KSM)。该度量标准衡量语料库关键词与较小词袋之间的语义一致性。大量实验表明,与包括ChatGPT和GPT4在内的多个大型语言模型相比,我们的方法具有出色的性能。

关键词

引用

@article{arxiv.2404.04854,
  title  = {Contextual Chart Generation for Cyber Deception},
  author = {David D. Nguyen and David Liebowitz and Surya Nepal and Salil S. Kanhere and Sharif Abuadbba},
  journal= {arXiv preprint arXiv:2404.04854},
  year   = {2024}
}

备注

13 pages including references