AMOR:构建可适应模块化知识智能体的配方——通过过程反馈
计算与语言
2024-10-28 v2
摘要
大型语言模型(LLM)的显著成功催生了构建用于完成各种复杂任务的语言智能体的潮流。我们提出 AMOR,一个基于开源 LLM 的智能体框架,通过人类对推理过程的监督来适应特定领域。AMOR 基于有限状态机(FSM)构建推理逻辑,通过自主执行和跨离散模块的转换来解决问题。这使得人类能够直接反馈到 individual 模块,从而自然形成过程监督。基于此推理和反馈框架,我们通过两阶段微调开发了 AMOR:预热阶段和适应阶段。前者使用来自 various public 数据集自动构建的示例对 LLM 进行微调,使 AMOR 能够跨越不同知识环境的泛化;后者则通过过程反馈将 AMOR 定制化于特定领域。跨多个领域的大量实验表明,AMOR 因其基于 FSM 的推理和过程反馈机制在强大基线上具有优势。代码和数据已公开于 \url{https://github.com/JianGuanTHU/AMOR}。
引用
@article{arxiv.2402.01469,
title = {AMOR: A Recipe for Building Adaptable Modular Knowledge Agents Through Process Feedback},
author = {Jian Guan and Wei Wu and Zujie Wen and Peng Xu and Hongning Wang and Minlie Huang},
journal= {arXiv preprint arXiv:2402.01469},
year = {2024}
}
备注
NeurIPS 2024