中文

TRACEALIGN——追踪漂移:将对齐失败归因于LLM训练时信念来源

人工智能 2025-08-05 v1

摘要

针对因对抗提示、解码扰动或改写式jumpstart等因素导致的LLM对齐漂移问题,细化后对齐的人类价值观模型常会产生不安全或政策违规的输出。虽然先前工作对对齐失效进行了行为层面的表征,但关于这些失效背后的训练时信念来源鲜有了解。我们引入TraceAlign框架,统一追踪不安全输出至模型训练语料库中根本原因。核心方法是基于后缀数组匹配检索训练文档,构建信念冲突指数 (BCI),以量化生成文本片段与对齐政策之间的语义不一致性。我们提出三种互补干预措施:(i) TraceShield,一种基于高BCI片段的推理时安全过滤器,拒绝生成高BCI的输出;(ii) 对抗性信念去冲突损失,一种对抗微调目标,惩罚DPO期间高BCI的延续;(iii) Prov-Decode,一种基于来源感知的解码策略,预防预测将导致高BCI片段的beam扩展。这些防御措施在我们精选的Alignment Drift Benchmark (ADB) 上将对齐漂移降低最高85%,同时保持标准任务的实用性,delta值小于0.2且拒绝质量得到提升。我们进一步通过后缀数组片段统计推导漂移发生概率的理论上界,将记忆频率和长度与对抗性重激活风险关联。TraceAlign为理解和缓解对齐失效提供了首个可扩展、可追踪且可根源化的工具链。为鼓励进一步探索与发展,我们开源代码于:https://anonymous.4open.science/r/tracealign-DA7。

关键词

引用

@article{arxiv.2508.02063,
  title  = {TRACEALIGN -- Tracing the Drift: Attributing Alignment Failures to Training-Time Belief Sources in LLMs},
  author = {Amitava Das and Vinija Jain and Aman Chadha},
  journal= {arXiv preprint arXiv:2508.02063},
  year   = {2025}
}