通过行为引导实现可信多轮LLM代理
人工智能
2025-12-15 v1
摘要
大型语言模型展现出强大的推理与生成能力,但在多轮任务中往往缺乏可靠性和可验证性。我们提出一种任务完成框架,使基于LLM的代理能够在以强化学习形式描述的环境中运行,该环境定义了观察、动作和奖励信号。该框架集成了三个组件:一个轻量级任务概化器,用于选择推理和生成策略;一个学习可验证观察-动作映射的推理模块;一个通过验证或确定性合成来强制执行约束的生成模块。我们表明,随着代理与环境交互,这些组件会协同演化,产生可信的行为。
引用
@article{arxiv.2512.11421,
title = {Towards Trustworthy Multi-Turn LLM Agents via Behavioral Guidance},
author = {Gonca Gürsun},
journal= {arXiv preprint arXiv:2512.11421},
year = {2025}
}
备注
Accepted to AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)