超越表面相似性:用于基础模型合成训练数据的层次化污染检测
机器学习
2025-11-25 v1 人工智能
摘要
合成数据已成为基础模型训练的重要素材,但基准数据污染威胁了评估的可靠性。虽然现有检测方法识别词汇级别的重叠,却无法检测到在无词汇重叠情况下概念上接近基准数据的语义层面污染。这一差距尤为关键,因为基础模型日益训练于可能隐式编码基准知识的合成数据。我们提出一种层次化污染检测框架,涵盖四个层次:词汇层面、语义层面、推理模式以及性能临界值检测。通过对 MMLU、GSM8K 和 HumanEval 的受控实验,我们展示语义层面污染可被现有方法检测不到(F1=0.17-0.49),但通过我们的层次化方法可有效检测(F1=0.76),平均超过最先进基线提升26.5%。该框架为实践者提供了用于审计管道的实用工具,支持合成训练数据的负责任部署。
引用
@article{arxiv.2511.17602,
title = {Beyond Surface-Level Similarity: Hierarchical Contamination Detection for Synthetic Training Data in Foundation Models},
author = {Sushant Mehta},
journal= {arXiv preprint arXiv:2511.17602},
year = {2025}
}