基于协作大语言模型代理的知识驱动自动特征提取
人工智能
2025-11-20 v1 计算与语言
摘要
机器学习模型在表格数据上的性能严重依赖于高质量的特征工程。虽然大语言模型(LLM)在自动化特征提取(AutoFE)方面显示出前景,但现有方法常受制于单一的LLM架构、简陋的定性反馈以及未能系统性地整合外部域知识。本文引入了Rogue One,一种新型的、基于LLM的多代理框架,用于知识驱动的自动特征提取。Rogue One 通过构建由三位专职代理构成的去中心化系统,这些代理协作迭代地发现、生成和验证预测特征。关键在于,该框架超越原始的准确率分数,引入丰富的定性反馈机制和“灌溉-修剪”策略,使其能够动态平衡特征的探索与开发。通过集成检索增强(RAG)系统,Rogue One 主动整合外部知识,生成不仅在统计上强大,又在语义上有意义且可解释的特征。我们在19个分类和9个回归数据集上表明,Rogue One显著优于最新方法。进一步地,我们定性地展示了该系统会揭示新的可检验假设,例如在肌肉数据集中识别出新的潜在生物标志物,凸显了其作为科学发现工具的实用性。
引用
@article{arxiv.2511.15074,
title = {Knowledge-Informed Automatic Feature Extraction via Collaborative Large Language Model Agents},
author = {Henrik Bradland and Morten Goodwin and Vladimir I. Zadorozhny and Per-Arne Andersen},
journal= {arXiv preprint arXiv:2511.15074},
year = {2025}
}
备注
19 pages, 4 figures, in review