中文

通过 LLM 智能体受限拓扑中的规划实现可靠的机器学习特征工程

机器学习 2026-01-19 v1 人工智能 计算与语言 多智能体系统

摘要

代码生成模型的最新进展为自动化特征工程释放了前所未有的机遇,但它们在现实世界机器学习团队中的采用仍受到关键挑战的制约: 捕获生产级特征工程的迭代和复杂编码过程的数据集稀缺; 广泛使用的编码智能体(如 CoPilot 和 Devin)与团队独有的工具、代码库、工作流和实践的集成与个性化有限; 由于反馈时机不当或不足导致人机协作欠佳。我们通过一个规划器引导的、受限拓扑的多智能体框架来解决这些挑战,该框架以多步方式为代码库生成代码。由 LLM 驱动的规划器利用以图表示的团队环境,来编排对可用智能体的调用,生成上下文感知的提示,并利用下游失败来追溯地纠正上游产物。它可以在关键步骤请求人工干预,确保生成的代码是可靠的、可维护的,并符合团队期望。在一个新颖的内部数据集上,我们的方法在评估指标上分别比手工制作的工作流和未规划的工作流提高了 38% 和 150%。在实践中,当为服务于超过 1.2 亿用户的推荐模型构建特征时,我们的方法通过将特征工程周期从三周缩短至一天,产生了现实世界的影响力。

关键词

引用

@article{arxiv.2601.10820,
  title  = {Towards Reliable ML Feature Engineering via Planning in Constrained-Topology of LLM Agents},
  author = {Himanshu Thakur and Anusha Kamath and Anurag Muthyala and Dhwani Sanmukhani and Smruthi Mukund and Jay Katukuri},
  journal= {arXiv preprint arXiv:2601.10820},
  year   = {2026}
}