ATA:实现自主可信代理的神经符号方法
计算与语言
2025-10-21 v1 人工智能
摘要
大型语言模型 (Large Language Model, LLM) 已展现出惊人的能力,但其在高风险领域的部署受限于其内在可信度局限性,包括幻觉、不稳定以及缺乏透明度。为解决这些挑战,我们引入了一种通用神经符号方法,称为自主可信代理 (Autonomous Trustworthy Agents, ATA)。我们方法的核心在于将任务解耦为两个 distinct 阶段:离线知识摄取和在线任务处理。在知识摄取阶段,LLM 将非正式的问题规格翻译为形式化、符号化的知识库。这种形式化表征至关重要,因为它可以由人类专家进行验证和细化,确保其正确性和与领域要求的一致性。在随后的任务处理阶段,每个输入被编码为相同的形式语言。符号决策引擎然后利用该编码输入和形式化知识库来派生可靠结果。通过在复杂推理任务上的广泛评估,我们展示了一个具体的 ATA 实现在完全自动化的设置下与最先进的端到端推理模型相当,同时保持可信度。至关重要的是,在人类验证和校正的知识库存在下,我们的方法即使在更大模型的情况下也显著优于甚至更好,同时表现出完美的确定性、对输入扰动的增强稳定性以及对提示注入攻击的内在免疫力。通过生成基于符号推理的决策,ATA 提供了一种实用且可控的架构,用于构建下一代透明、可审计且可靠的自主代理。
引用
@article{arxiv.2510.16381,
title = {ATA: A Neuro-Symbolic Approach to Implement Autonomous and Trustworthy Agents},
author = {David Peer and Sebastian Stabinger},
journal= {arXiv preprint arXiv:2510.16381},
year = {2025}
}