通过因果影响提示提高LLM代理安全性
人工智能
2025-07-02 v1 计算与语言
机器学习
摘要
随着由大型语言模型(LLMs)驱动的自主代理在 various辅助任务中不断展示潜力,确保其安全可靠的行为对于防止意外后果至关重要。本 work引入了CIP,这是一种新颖技术,利用因果影响图(CIDs)来识别和缓解源于agent决策的风险。CIDs提供了cause-and-effect关系的结构化表示,使agent能够预见有害结果并做出更安全的决策。我们的方法包含三个关键步骤:(1)基于任务规格初始化CIDs以概述决策过程,(2)使用CIDs引导agent与环境的交互,(3)根据观察到的行为和结果迭代细化CIDs。实验结果表明,我们的方法在 code execution和 mobile device control任务中有效提升了安全性。
引用
@article{arxiv.2507.00979,
title = {Enhancing LLM Agent Safety via Causal Influence Prompting},
author = {Dongyoon Hahm and Woogyeol Jin and June Suk Choi and Sungsoo Ahn and Kimin Lee},
journal= {arXiv preprint arXiv:2507.00979},
year = {2025}
}
备注
Accepted at ACL 2025 Findings, Source code: https://github.com/HahmDY/causal_influence_prompting.git