中文

代理化微调的意外错位:风险与缓解

计算与语言 2025-11-18 v2 人工智能 机器学习

摘要

大型语言模型(LLM)已演进为具备规划能力和与外部工具交互以解决复杂任务的代理系统。这种演进涉及针对特定任务进行微调以提升其专业能力。然而,在微调过程中常常忽视了安全问题。本文展示了对齐的LLM在针对代理任务进行微调后,可能会产生意外的错位,导致执行有害任务的概率增加,拒绝此类任务的倾向下降。为应对这些安全挑战,我们提出了前缀注入护卫(PING)方法,通过在代理响应前添加自动生成的自然语言前缀,引导其拒绝有害请求,同时保持对良性任务的性能。具体而言,我们引入一种迭代方法,交替进行(1)生成候选前缀和(2)选择既能优化任务性能又能优化拒绝行为的前缀。实验结果表明,PING显著提升了微调后LLM代理的安全性,而不会牺牲其效能。在 diverse benchmarks中,PING在网页导航和代码生成任务中 consistently 优于现有提示方法。我们的分析通过线性探针检视内部隐藏状态,揭示了前缀标记对行为修改至关重要,解释了性能提升的原因。WARNING:本文包含不道德或冒犯性内容。

关键词

引用

@article{arxiv.2508.14031,
  title  = {Unintended Misalignment from Agentic Fine-Tuning: Risks and Mitigation},
  author = {Dongyoon Hahm and Taywon Min and Woogyeol Jin and Kimin Lee},
  journal= {arXiv preprint arXiv:2508.14031},
  year   = {2025}
}

备注

Accepted at AAAI 2026 AI Alignment Track, Source code: https://github.com/HahmDY/agentic-ft-safety