AutoMalDesc:用于网络安全威胁研究的大规模脚本分析
密码学与安全
2025-11-18 v1 人工智能
计算与语言
机器学习
摘要
尽管自动化恶意软件检测系统取得了显著进展,但为威胁检测生成详尽的自然语言解释仍是网络安全研究中的开放问题.本文提出AutoMalDesc,一个自动静态分析摘要框架,该框架在针对小型专家精选示例进行初始训练后,即可独立且大规模地运行.该方法利用迭代自适应学习管道,通过合成数据生成和验证循环逐步提升输出质量,无需大量手动数据标注.在5个脚本语言中覆盖3,600个多样化样本的评估表明,各迭代之间在摘要质量和分类准确率方面均实现统计显著的改进,显示出持续的质量提升.我们的全面验证方法结合基于已建立恶意软件标签的量化指标与来自人类专家和基于LLM的裁判员的定性评估,确认了所生成摘要的技术精确性和语言连贯性.为促进可重复性并推动该领域的研究,本文发布了完整的10余万个脚本样本数据集,包括已标注的种子数据(900个)和测试数据(3600个),以及我们的 метод论和评估框架.
引用
@article{arxiv.2511.13333,
title = {AutoMalDesc: Large-Scale Script Analysis for Cyber Threat Research},
author = {Alexandru-Mihai Apostu and Andrei Preda and Alexandra Daniela Damir and Diana Bolocan and Radu Tudor Ionescu and Ioana Croitoru and Mihaela Gaman},
journal= {arXiv preprint arXiv:2511.13333},
year = {2025}
}
备注
Accepted at AAAI 2026 (oral)