从数据到行为:在训练前预测模型的意外行为
机器学习
2026-02-05 v1 人工智能
计算与语言
计算机与社会
信息检索
摘要
大型语言模型(LLMs)可以从看似无害的训练数据中获取意外偏见,尽管这些数据中没有明确的线索或恶意内容。现有方法在微调前难以检测此类风险,导致事后评估成本高昂且效率低下。为解决这一挑战,我们提出了 Data2Behavior—a 个新的用于预测训练前意外模型行为的任务。我们还提出了操纵数据特征(MDF,Manipulating Data Features),这是一种轻量级方法,通过对候选数据进行均值表示汇总,并将其注入基础模型的前向传播中,从而在不更新任何参数的情况下,让数据中潜在的统计信号影响模型激活,从而揭示潜在的偏见和安全风险。MDF 在可靠预测方面表现出色,仅需约为微调所需 GPU 资源的 20%。在 Qwen3-14B、Qwen2.5-32B-Instruct 和 Gemma-3-12b-it 上的实验表明,MDF 能够预见意外行为,并为预训练漏洞提供见解。
引用
@article{arxiv.2602.04735,
title = {From Data to Behavior: Predicting Unintended Model Behaviors Before Training},
author = {Mengru Wang and Zhenqian Xu and Junfeng Fang and Yunzhi Yao and Shumin Deng and Huajun Chen and Ningyu Zhang},
journal= {arXiv preprint arXiv:2602.04735},
year = {2026}
}
备注
Work in progress