中文

从数据到行为:在训练前预测模型的意外行为

机器学习 2026-02-05 v1 人工智能 计算与语言 计算机与社会 信息检索

摘要

大型语言模型(LLMs)可以从看似无害的训练数据中获取意外偏见,尽管这些数据中没有明确的线索或恶意内容。现有方法在微调前难以检测此类风险,导致事后评估成本高昂且效率低下。为解决这一挑战,我们提出了 Data2Behavior—a 个新的用于预测训练前意外模型行为的任务。我们还提出了操纵数据特征(MDF,Manipulating Data Features),这是一种轻量级方法,通过对候选数据进行均值表示汇总,并将其注入基础模型的前向传播中,从而在不更新任何参数的情况下,让数据中潜在的统计信号影响模型激活,从而揭示潜在的偏见和安全风险。MDF 在可靠预测方面表现出色,仅需约为微调所需 GPU 资源的 20%。在 Qwen3-14B、Qwen2.5-32B-Instruct 和 Gemma-3-12b-it 上的实验表明,MDF 能够预见意外行为,并为预训练漏洞提供见解。

关键词

引用

@article{arxiv.2602.04735,
  title  = {From Data to Behavior: Predicting Unintended Model Behaviors Before Training},
  author = {Mengru Wang and Zhenqian Xu and Junfeng Fang and Yunzhi Yao and Shumin Deng and Huajun Chen and Ningyu Zhang},
  journal= {arXiv preprint arXiv:2602.04735},
  year   = {2026}
}

备注

Work in progress