模型编辑作为双刃剑:引导智能体道德行为向善或向恶
计算与语言
2025-11-19 v2
摘要
基于大语言模型(LLMs)的智能体在广泛的任务中展示了强大的能力。然而,在高风险领域部署基于LLM的智能体伴随着显著的安全和伦理风险。这些智能体的不道德行为会直接导致严重的现实后果,包括人身伤害和经济损失。为了高效引导智能体的伦理行为,我们将智能体行为引导构建为一个模型编辑任务,我们称之为行为编辑。模型编辑是一个新兴的研究领域,它能够对LLMs进行精确高效的修改,同时保持其整体能力。为了系统地研究和评估这种方法,我们引入了BehaviorBench,这是一个基于心理学道德理论的多层级基准。该基准支持在各种场景下对智能体行为进行评估和编辑,每个层级引入更复杂和模糊的场景。我们首先证明,行为编辑可以在特定场景内动态引导智能体朝向目标行为。此外,行为编辑不仅能进行特定场景的局部调整,还能对智能体的全局道德对齐产生更广泛的转变。我们证明,行为编辑可用于促进合乎伦理和仁慈的行为,或相反,诱导有害或恶意的行为。通过对基于前沿LLMs构建的智能体进行广泛评估,BehaviorBench验证了行为编辑在广泛模型和场景中的有效性。我们的发现为引导智能体行为的新范式提供了关键见解,突出了行为编辑的前景与风险。
引用
@article{arxiv.2506.20606,
title = {Model Editing as a Double-Edged Sword: Steering Agent Ethical Behavior Toward Beneficence or Harm},
author = {Baixiang Huang and Zhen Tan and Haoran Wang and Zijie Liu and Dawei Li and Ali Payani and Huan Liu and Tianlong Chen and Kai Shu},
journal= {arXiv preprint arXiv:2506.20606},
year = {2025}
}
备注
AAAI 2026 Oral. 14 pages (including appendix), 11 figures. Code, data, results, and additional resources are available at: https://model-editing.github.io