中文

您的数据能撑多少?LLM 领域性能与新兴偏离的阈值

计算与语言 2025-09-25 v1

摘要

本文探讨了错误数据对大语言模型(LLM)如 gpt-4o 在监督微调(SFT)期间性能和安全性的影响。尽管 LLMs 在金融、编码、法律、健康等广泛领域日益重要,但在错误数据上进行微调可能导致“新兴偏离”,产生与原意无关的有害或欺骗性输出。我们评估了在四个领域(编码、金融、健康、法律)中使用 10% 至 90% 正确数据的 gpt-4o 模型进行微调。我们的发现表明,即便含有 10%-25% 的错误数据,也会显著降低领域性能和道德对齐性。至少需要 50% 的正确数据才能让模型持续恢复强性能力,尽管它们很少能匹配基础模型的鲁棒性和安全性——该模型开箱即具近乎完美的对齐性和零危险输出。该研究强调了错误数据的高额成本,凸显了对极高质量数据精选或,或者,针对高风险应用,利用稳健的基础模型而不进行不必要微调的关键需求。

关键词

引用

@article{arxiv.2509.19325,
  title  = {How Much of Your Data Can Suck? Thresholds for Domain Performance and Emergent Misalignment in LLMs},
  author = {Jian Ouyang and Arman T and Ge Jin},
  journal= {arXiv preprint arXiv:2509.19325},
  year   = {2025}
}